正在加载视频...

视频加载失败

设计好一个 skill之后:扔一个 mp3 录音,10 分钟后,出来一个 explainer video。 目前走“自研”路线,不用已有的动画库。迭代几轮之后,目前已经比较稳定了。 opus 5.5 的能力是人人可用的,但是,harness 层面,对视频制作流程、视觉风格、技术路线……以及诸多细节问题的理解和判断,才决定一个人能否做出达到品质标准的作品。

11,442 次观看 • 6 天前 •via X (Twitter)

6 条评论

Ethpunk 的头像
Ethpunk6 天前

还以为开源了

景哥|AI落地与智能体实践 的头像
景哥|AI落地与智能体实践6 天前

这个工作流很吸引人:丢入 MP3,十分钟产出完整讲解视频,自研链路不依赖现成动画库。Opus5.5 本身只是底层生成引擎,Harness 层的编排决定成片上限。你在这套流程里,觉得最难调的是画面节奏对齐音频,还是统一全程视觉风格?相关 AI 视频工程实践主页有记录。

Seki 的头像
Seki6 天前

模型能力拉平后,真正的门槛变成了对生产流的控制力,和原始数据/素材产生。另外一个,归根结底品味还是最重要的,也是最难的

uuvioz 的头像
uuvioz6 天前

还可以再优化

小溪OK50帆 的头像
小溪OK50帆6 天前

这种工作流简直是解放创作者的生产力神器

cloutusf 的头像
cloutusf6 天前

能力人人可用,判断力没法

相关视频

这个Skill真的让我看到了一个人干翻一个动画工作室的可能性,我用它做了个DeepSeek V4-Flash的视频, 一个人,一条指令,40块钱,2分钟电影感动画科普视频。 不是那种一眼AI的垃圾。是角色不崩、声音一致、镜头有语言、旁白有节奏的正经片子。 这东西叫animated-voiceover,刚开源,MIT协议。作者是前字节产品经理sida,他自己已经用这套东西在小红书起号了。 它不是软件,不是App,是一套喂给Codex/Claude Code的完整制片流程。你就跟它说一句:"用animated-voiceover做一条两分钟关于确认偏误的动画科普",剩下的Agent按流程给你跑: 先研究,写完整旁白, 锁视觉风格参考图,锁角色参考图。 每15秒拆成5个镜头,每个镜头写清主体、变化、镜头运动。 先生成第1段,把人声提出来,48kHz立体声WAV锁死。 后面所有片段全部挂这同一个人声参考——声音飘的问题,工程化解决了。 逐段QC,旁白完整性、角色一致性、构图、运动,不合格重来。 最后拼成片,做封面。 最狠的是它解决问题的方式,全是工程思维,不是玄学。 AI视频最大的痛点是什么?声音每段都不一样,角色脸走着走着就变了,镜头之间没有逻辑。 他怎么干的?先做第一段,把人声锚定,后面全挂这个参考。 一张风格图贯穿全片,每个角色独立参考图+角色表管理。 旁白写完再切,中文卡到每15秒60个字,多一个少一个都不行,信息密度均匀,不机械。 这不是"帮我生成个视频",这是把一个专业动画导演脑子里的制片流程,变成了Agent可以执行的Skill。 一条2分钟的片子,LibTV跑下来大概40块钱。一个人,一个下午,从选题到成片。以前这活儿得一个团队干一周。 作者反复强调一句话:90%自动化,但那10%人的判断决定上限。你定选题、定风格、卡审批,剩下重复的、容易出错的、熬人的,全交给Agent。 这才是Agent Skill该有的样子, 不是跟你聊天,不是帮你写个Prompt,是把一整条专业生产管线——从研究到脚本到分镜到渲染到QC到成片——封装成一个你随时可以调用的能力。 知识博主、超级个体、想做深度内容但不会动画的人,这个东西的价值怎么强调都不过分。B站、小红书那些电影感科普号,以前得团队作战,现在一个人就能干。 GitHub搜s1dashu/animated-voiceover,SKILL.md和references目录里全是干货,旁白怎么写、分镜怎么拆、声音怎么锁、Seedance的提示词怎么用,全给你摊开了。 别再问AI能不能替代内容创作者了,会用这种工具的创作者,正在替代不会用的。

AYi

21,974 次观看 • 2 个月前

HeyGen这次开源,把AI做视频的最后一道门槛拆没了🤯 他们用Claude Code写代码,做了自己的50秒产品发布视频,然后把整个工具链完整开源给了所有人,致敬开源🫡 以后做视频真的能简单到离谱, 给一句话,做一个30秒的产品介绍,给一个PDF,自动生成总结视频, 迭代就是改一句话的事,比如把标题放大两倍,第三秒加一个淡入转场等, 这个工具叫HyperFrames,本质上就是一个纯HTML转MP4的视频渲染框架。 所以其实我们不用学任何剪辑软件,也不用写复杂的React代码, 只要写普通HTML,加几个简单的data属性,就能定义视频的每一帧、时间线、动画和音轨。 HyperFrames从第一天起就是为AI代理原生设计的。 AI天生就会写HTML,现在Claude、Cursor、Gemini所有编码Agent,只要装一个skill,立刻就会做视频。 这妥妥的降维打击啊,以前Remotion把视频变成了代码,但它需要你会React,需要构建流程,属于开发者专属的玩具。 HyperFrames是把视频变成了纯HTML,零构建,无DSL,不需要任何前置知识。 说白了,Remotion是给人写的,HyperFrames是给AI写的。 以前AI能写文字,能生成图片,但视频一直是最后一块硬骨头,现在这块骨头也被啃下来了。 代理现在能端到端完成一整条内容流水线,调研,写脚本,做设计,加动画,最后直接渲染出成品视频,全程不需要人类碰一下。 它还自带50+官方现成组件,社交遮罩、图表、转场,一行命令一键安装。 支持GSAP、Lottie、Three.js所有主流动画库,随便混用。 也就是说,同一份HTML永远出一样的结果,完美适合自动化流水线。 官方甚至把视频语言都标准化了,缓动用snappy,bouncy,转场用能量等级,字幕分Hype/Corporate/Tutorial三种风格。 AI只要学会这套词汇,就能稳定输出专业级视频,这不就是在教AI做导演嘛🤣 这对HeyGen来说也是一步妙棋,他们不再只是一个卖AI头像的SaaS公司,现在能做整个AI视频时代的基础设施了, 未来所有AI代理生成的视频都能跑在HyperFrames上。 然后再无缝接入HeyGen的头像、语音、翻译能力,形成一个完美的闭环。 当然目前也不是完美的,初期输出还有AI味,超过一分钟的复杂长视频,渲染还需要较强算力。 但我觉得这都不重要,关键是它第一次把完整的视频生产力交给了AI Agent,相当于AI内容创作时代的又一个里程碑。 想试的直接去GitHub搜heygen-com/hyperframes。 跑一行npx hyperframes init,然后让Claude帮你做第一个视频。 #HyperFrames #HeyGen #AI视频 #AI代理 #开发者 #内容创作

AYi

37,069 次观看 • 5 个月前