Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

第一次生成长视频!! 从此,垃圾小视频生产者再添一位 复盘总结: 1️⃣方法 本次根据上个视频的方法,进一步延伸, 和gpt 5.6Sol讨论故事剧本、镜头脚本,角色参考卡 但这次不一样的在于,生成视频直接用的即梦的agent模式, agent模式下,可以直接出多段视频 2️⃣问题 ①视频格式忘记约束了,原本想要16:9的 ②资产没约束,只约束力角色形象,其它的场景和道具没有约束,所以出现了道具前后不一致,场景不一致的情况 3️⃣感慨 我自己是不会写剧本的,但是我可以审阅AI生成的内容,提出哪里不合理的地方,然后让它朝我想要的方向调整 如果GPT是个人,它肯定想骂我,怎么改来改去最后回到初版 本次作为第一次出长视频,还是有很多问题值得慢慢复盘的 并且本次发现,原来那些在身边习以为常的工具,其实我并不熟悉,我还是第一次使用即梦的agent功能(和豆包有点像),也是第一次使用gpt的任务模式。 在熟悉的边界去探索未知,即有安全感,也能成长 #nana #AIGC #AIart #AI视频 #AI漫剧

141,953 Aufrufe • vor 27 Tagen •via X (Twitter)

0 Kommentare

Keine Kommentare verfügbar

Kommentare vom Original-Post werden hier angezeigt

Ähnliche Videos

飞书+豆包这个组合真的太牛逼了!自从豆包和飞书集成之后,结合抖音的字节生态,可以直接提取某个抖音博主的(don哥、李守洲等人)逐字稿了 如果你觉得一个博主的方法论特别有用,那你就可以和豆包说直接把它提取出来,并分门别类进行多维表格化的整理 你就会发现他变成一组数据进入到你的飞书了 我这次用飞书里的豆包,做了一件原来很烦的事,并最后形成了一套用AI做选题的方法论 我这次抓 20 个“用 AI 做选题”的视频,直接把这些视频的内容转成逐字稿,再放进飞书多维表格里 这件事我一开始是没想到的,因为按原来的做法,你想拆一个视频的方法论,基本就是:用Get笔记复制一下项目链接,再复制再粘贴,最后拿到的东西很散 说豆包和飞书这次结合起来,我就直接把任务派给了豆包,看视频就行了 我把任务丢给豆包「先抓 20 个 AI 找选题相关视频」 再把视频内容转成逐字稿,然后落到飞书多维表格里,继续做分类、提炼、整理 最后出来了 3 个交付物,这些我觉得都很实用: 一张原始素材表:20 条视频记录,带逐字稿、点赞数据和视频链接 一张方法论整理表:32 条方法论,拆成 5 大类,做了 13 个字段 一篇约 6000 字的文章:从工具使用者到系统构建者的五层进阶 这才是我觉得飞书里的豆包最适合内容创作者的地方,这也是它和WorkBuddy等仅仅切入B端市场不同的地方,就是它真的在照顾每一个使用飞书的人,每一个使用字节产品的人,把生态打造成了一个绝对的壁垒 它能把“找素材”和飞书结合起来,往后推进成一个可以继续用的工作台 最有意义的就是它先帮我把别人视频里的有效表达扒出来 再把这些逐字稿变成结构化表格,再从表格里提炼方法论 最后沉淀成一篇可以发出去的文章,甚至可以反过来做成一个“AI 找选题方法论”的 skill 这条链路很像我最近一直在讲的那句话:AI 内容创作不是生成,而是消化 而豆包进入飞书表格之后,飞书多维表格在这里就不是普通表格了 它更像一个内容生产的中控台:原始素材、逐字稿、方法分类、适用场景、后续文章,都能接在一起,还有更多玩法,我后面慢慢来更新 飞书还有各类免费的直播课!想听的直接扫描评论区的二维码及时接收提醒,量大管饱!!!

叫我阿杭

16,002 Aufrufe • vor 9 Tagen

AI 视频生成,到各种 AI Agent,我一直在思考一个问题:AI 最终会如何改变人类创造和体验数字世界的方式? 最开始,AI 帮助我们生成文字和图片;后来,它开始生成越来越逼真的视频。但无论画面质量提升到什么程度,这些内容依然存在一个限制——我们仍然只是观看者。我们可以欣赏 AI 创造出来的场景,却无法真正进入其中,也无法与这个世界产生互动。 最近体验 Alaya World Alaya Lab 后,我第一次感觉,AI 视频生成正在探索一个新的方向:它不只是生成一段视频,而是在尝试生成一个可以被探索的世界。 Alaya World 是 Alaya Lab 推出的交互式视频世界模型。用户可以通过文字、图片或者视频作为初始条件,让模型生成一个动态世界。不同于传统视频生成模型“输入 Prompt,输出一段固定视频”的方式,Alaya World 更像是在探索过程中持续构建环境,用户可以在生成的世界中移动视角,并通过交互指令触发新的事件。 这也是我认为世界模型和普通视频生成模型最大的区别。 过去的视频生成模型解决的是“如何生成一段更加真实的视频”,而世界模型尝试解决的问题是“如何让一个世界持续存在”。如果你进入一个虚拟城市,向前探索,然后回头,你期待看到的是同一个城市,而不是一个重新随机生成的场景。 这背后涉及世界模型最核心的挑战:长时间生成的一致性。模型不仅需要知道下一帧画面应该是什么,还需要理解空间关系、历史状态以及用户行为对世界造成的影响。 Alaya World 在技术层面通过空间记忆机制、历史信息保留以及抗漂移训练等方式,提高长时间生成过程中的稳定性。目前模型支持 720p / 24 FPS 实时流式生成,并展示了超过一分钟的连续探索能力。 让我觉得这个方向有意思的地方,是它可能会重新定义未来数字内容的生产方式。 以游戏行业为例,过去一个虚拟世界需要大量人工制作:美术设计地图、程序编写规则、策划设计剧情。开发者需要提前创造一个固定世界,而玩家进入后按照既定规则体验。 但如果世界模型进一步发展,未来的游戏可能不再只是“开发者搭建世界,玩家进入世界”,而是“开发者定义规则,AI 实时生成世界”。玩家体验的不再是一个完全预设好的内容,而是一个随着交互不断变化的环境。 当然,Alaya World 目前仍然处于早期阶段。实时生成所需的算力成本、复杂环境理解能力,以及更长期、更稳定的世界一致性,都还有很多问题需要解决。但它让我看到一个值得关注的趋势:AI 的竞争可能不会只停留在生成更漂亮的图片和视频,而是进一步走向创造更真实、更连续、更可交互的世界。 过去,人类通过电影记录想象,通过游戏创造虚拟空间。而未来,也许我们只需要描述一个想法,AI 就可以帮助我们生成一个能够进入其中、探索其中的世界。 从生成内容,到生成世界,这可能是 AI 下一阶段最值得期待的变化之一。

Ashlyn He

12,093 Aufrufe • vor 1 Monat

做 AI 短剧、小说号、AI 视频号的,可以重点看一下这个开源项目,叫 Toonflow-app。 它不是那种「输入一句话,直接给你生成一个视频」的玩具。 那种东西看演示很爽,真要拿来做内容,很快就会发现一地鸡毛:角色不一致,剧情接不上,分镜乱飞,素材越堆越多,最后文件夹里全是废片。 Toonflow 解决的是更前面的事。 它把小说、故事、剧本、角色、分镜、图片素材、视频节点,全部放进一个工作台里。 展示形态更像一个 AI 短剧生产后台,不是单纯聊天框。你可以导入小说,让它拆章节事件,生成故事骨架,再改成剧本,然后进入画布,把角色、场景、镜头、视频生成节点串起来。 这就有点意思了。 AI 视频真正难的,从来不是生成一个 5 秒镜头。 难的是你能不能把一堆镜头、一堆角色、一条剧情线,稳定组织成一个能看的作品。 Toonflow 的核心玩法就是:把「小说到短剧」这条流程拆开,再让不同 AI 模型去处理不同环节。 写剧本用文本模型,出角色图用图片模型,生成镜头用视频模型,最后在工作台里统一管理。 这类项目最适合三种人: 小说号想升级成 AI 漫剧。 短剧团队想降低前期试错成本。 AI 视频创作者想从单条演示,升级成连续内容生产。 说实话,这才是 AI 视频工具接下来该卷的方向。 不是炫一个镜头有多炸,而是能不能把内容稳定做出来。

老杨啊

16,040 Aufrufe • vor 3 Monaten

HeyGen这次开源,把AI做视频的最后一道门槛拆没了🤯 他们用Claude Code写代码,做了自己的50秒产品发布视频,然后把整个工具链完整开源给了所有人,致敬开源🫡 以后做视频真的能简单到离谱, 给一句话,做一个30秒的产品介绍,给一个PDF,自动生成总结视频, 迭代就是改一句话的事,比如把标题放大两倍,第三秒加一个淡入转场等, 这个工具叫HyperFrames,本质上就是一个纯HTML转MP4的视频渲染框架。 所以其实我们不用学任何剪辑软件,也不用写复杂的React代码, 只要写普通HTML,加几个简单的data属性,就能定义视频的每一帧、时间线、动画和音轨。 HyperFrames从第一天起就是为AI代理原生设计的。 AI天生就会写HTML,现在Claude、Cursor、Gemini所有编码Agent,只要装一个skill,立刻就会做视频。 这妥妥的降维打击啊,以前Remotion把视频变成了代码,但它需要你会React,需要构建流程,属于开发者专属的玩具。 HyperFrames是把视频变成了纯HTML,零构建,无DSL,不需要任何前置知识。 说白了,Remotion是给人写的,HyperFrames是给AI写的。 以前AI能写文字,能生成图片,但视频一直是最后一块硬骨头,现在这块骨头也被啃下来了。 代理现在能端到端完成一整条内容流水线,调研,写脚本,做设计,加动画,最后直接渲染出成品视频,全程不需要人类碰一下。 它还自带50+官方现成组件,社交遮罩、图表、转场,一行命令一键安装。 支持GSAP、Lottie、Three.js所有主流动画库,随便混用。 也就是说,同一份HTML永远出一样的结果,完美适合自动化流水线。 官方甚至把视频语言都标准化了,缓动用snappy,bouncy,转场用能量等级,字幕分Hype/Corporate/Tutorial三种风格。 AI只要学会这套词汇,就能稳定输出专业级视频,这不就是在教AI做导演嘛🤣 这对HeyGen来说也是一步妙棋,他们不再只是一个卖AI头像的SaaS公司,现在能做整个AI视频时代的基础设施了, 未来所有AI代理生成的视频都能跑在HyperFrames上。 然后再无缝接入HeyGen的头像、语音、翻译能力,形成一个完美的闭环。 当然目前也不是完美的,初期输出还有AI味,超过一分钟的复杂长视频,渲染还需要较强算力。 但我觉得这都不重要,关键是它第一次把完整的视频生产力交给了AI Agent,相当于AI内容创作时代的又一个里程碑。 想试的直接去GitHub搜heygen-com/hyperframes。 跑一行npx hyperframes init,然后让Claude帮你做第一个视频。 #HyperFrames #HeyGen #AI视频 #AI代理 #开发者 #内容创作

AYi

36,713 Aufrufe • vor 4 Monaten

把网站录下来给AI看, AI能照着做出来吗? 刚刚看到了个炫酷的灯具网站, 它有个功能是点击按钮直接能看到灯点亮的效果, 甚至网站的配色也会暗淡下来, 特别有氛围. 我突然想到, 这样的网站, 如果要让AI来做, 该怎么办? 把源代码拷给它? 用一个巨复杂的 prompt 来完成? 有没有可能, 我录个视频, 展示一下这个"关灯"的效果, 然后让AI来按照视频来写网站? 于是, 这个重任就交给了今天测试的模型, 百度刚出的文心-5.0-preview, 全模态大模型, 这个模型同时支持文本, 图片, 音频, 视频作为输入, 然后可以生成文本和图片, 所以我们这个测试可以最大化的利用它的能力. 我先录制了网站的效果, 然后写了prompt作为补充, 告诉它这个效果是怎样的, 以及准备的图片材料在哪里. 值得一提的是, 网站所展示的图片也是我用文心-5.0-preview生成的. 大家可以看视频中我生成的效果. 直接说测试结论: 目前每个模态都是可用的, 而且模态之间关联性非常好, 我测试了视频+文本, 图片+文本, 图片+语音, 都可以完成任务. 当然测试也发现了一些问题, 比如 token 输出速度不是特别快, 以及偶尔会有超时问题(已反馈给百度的同学). 我的使用建议是, 多利用它的多模态能力, 来完成之前不敢想象的任务, 它真的提升了使用场景的天花板. #文心大模型 #文心5 #百度 #文心一言 #ai教程

karminski-牙医

29,929 Aufrufe • vor 9 Monaten

AI 视频制作也接近了 GPT 时刻,视频智能体背后的工作原理🧵 AI 产品都有个可用性易用性的临界点,临界点之下,属于专业玩家的玩具,需要各种提示词技巧、专业知识才能用起来;临界点之上,就真正变成了普通人也可以用起来并且有用的工具。就像 AI 聊天,在 ChatGPT 之前,我们常笑话它们是人工智障,在 ChatGPT 之后,它是真的变成了一个有帮助的助手,能帮助我们完成很多任务,所以我们通常把 AI 产品跨过可用性通用型临界点叫 GPT 时刻。 类似的比如前不久 GPT-4o 发布的图片模型,提示词很简单,不需要像 MidJourney 那样需要专业的提示词才能生成好的图片作品,普通人都可以把自己天马行空的想法变成真实有趣的作品,我这样非专业的都玩了好一段时间。 像 AI 视频类产品我一直没怎么玩,因为对于我这样的非专业人士来说,做好视频太难了,创意和提示词反倒相对容易一点,主要是得写脚本、画图、声音、多条视频,剪辑,做好一条视频要费很多时间精力。 不过上面这条视频倒是没花我多少时间,我就输入了一条提示词: > 生成视频,主题是“西游记人物自拍视频,用自拍的方式来讲述《西游记》经典场景”,视频长度为2分钟。 发送到纳米AI然后等着就成了,整体看着还挺有趣,有画面有声音有剧情。让我觉得 AI 视频终于也接近了 GPT 时刻,普通人也可以通过简单的提示词就能做出还不错的视频作品,动动嘴就能出视频。对于创作者,也可以快速制作视频 Demo,将创意想法快速落地。

宝玉

26,346 Aufrufe • vor 1 Jahr