正在加载视频...

视频加载失败

前面发的 14 万粉 AI 道家号,没想到大家这么感兴趣 只拆别人还不够,我自己也把整条生产链路跑通了 完整流程我正在整理润色,今天先把成品放出来(图一) 这条视频从对标分析、选题、文案、分镜,到画面、配音、字幕和最终合成,都是由 Codex 调用我做的 Skill 串起来的 不是手搓出来的一条 Demo,而是一套可以持续生产的工作流(图二) 下一篇 Thread,我把完整过程拆开讲清楚

12,677 次观看 • 1 个月前 •via X (Twitter)

23 条评论

Outt 的头像
Outt1 个月前

牛逼

算岛 的头像
算岛1 个月前

关注一下,开源了叫我🧐

阿策 的头像
阿策1 个月前

没问题

Hoody 的头像
Hoody1 个月前

这一条成本大概多少呀,本地算力生成的么

JsonHu 的头像
JsonHu1 个月前

背景音乐怎么弄到流程里面,是本地素材导进去吗

阿策 的头像
阿策1 个月前

hyoerframe合并进去的

JsonHu 的头像
JsonHu1 个月前

要本地先下载bgm素材,然后在hyperframe是吧?

阿策 的头像
阿策1 个月前

是的,需要先扒下来

JsonHu 的头像
JsonHu1 个月前

感谢 佬

Timy 的头像
Timy1 个月前

可以啊策哥

peter ban 的头像
peter ban1 个月前

做的真好,我用workbuddy做的像个智障一样

阿策 的头像
阿策1 个月前

谢谢,我还没在workbuddy上跑过,后面优化一下,应该也能跑

Bobby 的头像
Bobby1 个月前

可以给我一个skill吗?

阿策 的头像
阿策1 个月前

后面有开源计划

Jerry 🐭 的头像
Jerry 🐭1 个月前

期待深入拆解👍

Flat 的头像
Flat1 个月前

期待大佬下一篇

沧海一声笑 的头像
沧海一声笑1 个月前

啧啧 真厉害啊

无须多言 ✦ AI Design 的头像
无须多言 ✦ AI Design1 个月前

这个完全能跑出高流量

阿旭gogogo 的头像
阿旭gogogo1 个月前

大佬,只靠codex能搞定吗?还是要其他AI视频的工具?

阿策 的头像
阿策1 个月前

只用了codex,里面的视频生成用了grok的api

不交社保 的头像
不交社保1 个月前

大佬 可以分享下配音吗

表弟 的头像
表弟1 个月前

期待大佬的下一篇

伟 翟 的头像
伟 翟1 个月前

期待大佬开源

相关视频

今天我花了6 个小时,把数字人做成了可上市的产品。 昨天数字人工具做出来后,我在反思 2 个问题: 1. HeyGen 的成本太高了每 10 秒 $0.6,一条 1 分钟的口播就是 $3.6。 2. 数字人工具有了,内容从哪里来?内容才是王。 在好友 0xMomo 的思路启发下,我把 GPT Researcher 接到了这条流程前面。 给它一个具体话题,先查资料、核验事实,再整理出适合口播的脚本。 我先尝试了完整的深度调研流程,测试下来发现日常生产内容太慢。 后来把 GPT Researcher拆分,只用他的 DuckDuckGo 检索器,做成功一个快速调研的 API 接口: 输入一个话题,自动拆分查询、并行搜索、过滤低质量来源,最后生成证据卡、3 版口播脚本和真实网页截图。 脚本来源解决后,我又调整了视频结构。 数字人只负责开场和结尾,中间用 B-roll 插入真实新闻、图表和资料截图。 按首尾合计约 30 秒计算,一条 1 分钟视频的 HeyGen 成本可以从 $3.6 降到约 $1.8。字幕、封面、B-roll 和最终合成都在本地完成。 现在一条完整的口播流程变成了: 具体话题 → GPT Researcher 里的 DuckDuckGo 快速调研与事实核验 → 生成 3 版证据脚本 → Qwen3-TTS 本地生成语音和试听 MP3 → 本地 ASR 检查 → 人工确认脚本、声音和 HeyGen 成本 → HeyGen 只生成数字人开场与结尾 → B-Roll 中间插入真实新闻和资料截图 → Remotion 添加字幕、封面和关注片尾 → 输出完整 MP4 我还把整套流程封装成了一个 Skill: $topic-to-digital-human-video(skill 稍后公布在评论区里) 只需要你提交一个话题, 比如:韩国股灾为什么这么严重吗? 它就会自动完成调研、事实核验、脚本、语音和素材整理。 在调用 HeyGen 花钱之前,流程会停下来让你再次确认。 接下来继续测试 ninglon 好友的建议:用cosyvoice做有情绪的声音克隆,用avatar,加LTX2.3对嘴型代替 heygen,他说他跑通了。 我一定要把 heygen 价格打下来。 这个话题的成片见视频。

左海

14,706 次观看 • 2 个月前

我把 AI 解说视频,彻底做成了一条“无人流水线” 丢进去文案和声音,后面的配音、分镜、画面、字幕、合成基本全自动 开源 4 天,350+ Stars,1000+ 人收藏。今天一次性把 cs-board 的全部功能讲透 并且新增加了自媒体封面修改功能,内置十种风格(还可以diy)还有市面上所有封面的尺寸(图二)👇 cs-board已经从一个 AI 白板视频工具,越改越像一个真正的 AI 内容生产工作台 以前用 AI 做一条内容,流程基本是这样的: 写文案 → 找模型改稿 → 克隆声音 → 拆分镜 → 生图 → 调风格 → 做动画 → 加字幕 → 做封面 → 导出 问题不是 AI 不够强 而是: 每一步都很强,但每一步都是孤岛 你要不断复制粘贴、切工具、重新上传素材、重新解释人物是谁、重新告诉模型你要什么风格 最后不是 AI 在替你工作,而是你成了 AI 工具之间的“人肉 API” 所以 cs-board 现在做的事情,本质上不是继续堆 AI 功能 而是把这些步骤做成一个有状态的内容生产工作台 1️⃣ 为什么我没有直接做“一键生成视频” 因为真正影响内容质量的,从来不是“一键” 而是中间状态能不能被控制和复用 比如现在 cs-board 生成一条视频,中间会留下: 配音 → 分镜 → 图片 → 分段视频 → 最终成片 这些都不是一次性的临时结果,而是检查点 假设你已经生成完所有图片,只是觉得字幕位置不对 正常 AI 工作流可能又得重新跑一遍 cs-board 不需要 直接从后面的渲染阶段继续 前面花过的钱和时间不重新花 我越来越觉得,AI 工具真正应该优化的,不是“第一次能不能生成”,而是: 第 17 次修改的时候,你还需不需要从头来一遍 2️⃣ 动态信息图为什么不是“让 AI 生成一张 PPT” 这个功能我改得比较久 因为我发现很多所谓 AI 视频,本质都有一个问题: 画面和人声是脱节的 旁白还没讲到第三点,画面已经把五点全部展示出来了 观众其实根本不会跟着你的表达走 所以 cs-board 的动态信息图不是: 文案 → HTML → 视频 而是先把真实旁白做成一个语义时间轴 一句话什么时候开始说、哪个关键词什么时候出现、哪个知识卡片什么时候展开,都跟实际音频绑定 所以画面不是按照“程序跑到第几秒”出现 而是: 你讲到哪,它才出现到哪 这其实是我现在做 cs-board 比较核心的一个思路: AI 负责理解内容,程序负责保证确定性 能交给代码控制的东西,我越来越不想交给模型猜 3️⃣ 为什么人物和画风要单独抽出来 以前最大的问题之一就是一致性。 第一张图是这个人。 第二张开始脸就变了。 第三张甚至连画风都换了。 所以现在自定义模式里,我把两件东西单独抽出来: 人物参考 + 风格参考。 可以放固定 IP,也可以放自己的品牌视觉。 人物最多可以提供多张参考图,风格也作为独立条件贯穿整个任务。 这意味着 cs-board 不只是帮你“生成一条视频”。 更重要的是: 它开始能够持续生产属于同一个 IP 的内容 对于真正做账号的人,这个区别非常大 4️⃣ 最近我又把封面也塞进去了 因为做完视频以后,我发现自己还得打开另一个工具做封面。 那干脆继续 Coding 现在封面制作直接放进工作台 粘贴文章 / 帖子内容以后: 自动理解内容 → 提炼标题 → 选择构图 → 生成人物与视觉 → 输出封面。 我没有只给一个“生成封面”按钮 而是先做了 10 种专业封面构图 因为封面的核心根本不只是图片好不好看 而是: 标题放哪、人物放哪、视觉重心在哪、第一眼先看到什么 构图是确定性的,审美才交给模型 这和前面动态信息图其实是同一套逻辑 5️⃣ 现在这个工作台正在慢慢变成什么 目前已经逐渐放进来了: 白板视频 / 自定义人物与画风 / 动态信息图 / 文案改写 / 对口型视频 / AI 封面制作 视觉模板现在也已经扩到了 12 套 音色克隆可以接本地 IndexTTS 任务、素材、配置、历史和成片默认都放本地 甚至同一个局域网里的电脑,可以共享制作队列 这也是我现在给 cs-board 定的方向: 不做一个 AI 视频生成器。 做一个可以不断往里面塞能力的 AI 内容生产工作台。 目前项目继续开源: 现在功能还远远没做完,下一步正在接入数字人工具 如图P3 但我觉得这条路,比继续做一堆“一键生成 XX”的小工具有意思多

陈硕KAI(耍门)

30,270 次观看 • 1 个月前

久等啦,创作者神器Viko终于上线!🥳( 前段时间我随手发过一个 Viko 的 demo视频,就那么一个很糙的版本,结果评论区和私信隔三差五就有人来问,什么时候能用,什么时候上线。 因为对我自己也是刚需,于是闭关爆肝了一个多月,终于来啦~ 它最开始,其实只是我给自己做的一个小工具。 我每天都会刷 Pin和各种作品站找灵感,我相信做 AIGC 视觉创作的人应该都懂。以前看到一张喜欢的图,我的流程是这样的,保存图片,丢进 GPT 反推拆解,复制出来改一改,再贴到生图工具里跑一遍。 做一张还好,一天几十张、上百张的时候,这套流程就显得非常非常繁琐。 所以最开始,我只想做一件特别简单的事: 看到好图,Viko 一下。 浏览任何网页的时候,鼠标悬停在图上,一键捕捉,一键拆解,直接进入下一步创作。 我也试过市面上很多反推插件,还停留在一个特别初级的阶段,丢进去一张图,吐回来一整段 Prompt。 坦率的讲,一整段 Prompt,对真正做创作的人来说,远远不够。 我真正想知道的是,这张图为什么好看。 它是什么视觉风格,构图为什么成立,用了什么镜头和光线,色彩关系是怎么组织的,材质、氛围、人物状态又是怎么形成的。 以及最关键的,到底是哪几个关键词,激发了这张图的「美学基因」。 所以Viko我希望是有这样的能力的 。 人像、动漫、商图、产品图等等,都可以沿着不同的视觉维度爆破拆解,风格、构图、镜头、光线、色彩、主体、材质、氛围,还有真正值得留下来的核心关键词。 你可以直接用完整 Prompt,也可以把某一个视觉元素单独抽出来,改一改,迁移到新的主题里继续二创。 一张图带给你的,就不再只是一句提示词。 你开始知道它为什么成立,也开始有了继续延展它的方法。 在这个基础上,我还做了两个我自己特别喜欢的模式: 第一个是色卡模式。 很多时候一张图让你第一眼觉得「就是这个感觉」,真正起作用的其实是那套配色关系。Viko 可以直接提取画面的核心色彩,把喜欢的配色留下来,迁移到完全不同的主题里。 第二个,是我个人觉得最爽的,内测期间大家最爱用的,动作参考模式。 人物动作一直是 AI 生图里最难搞的问题之一,所以viko针对此项做了专门处理,即使面对复杂肢体动作和高难度透视关系,也能从容、一键完成精准动作还原。 到这里,从一张灵感图开始,捕捉、拆解、理解、二次创作,这条链路已经通了。 但这就够了吗?of course not ! 今天反推出来的 Prompt,过几天还能不能找到? 刚发现的那个神仙关键词,下次创作的时候还能不能想起来? 那套很漂亮的配色、那个难得的动作参考、一次次验证过的构图,还有最后生成出来的作品,用完之后,去哪了? 散落在聊天记录里,收藏夹里,下载文件夹里,各种软件里。 每一次创作结束之后,我们其实都在丢失自己的经验,没有产生创作复利! 所以,资产管理慢慢变成了 Viko 更核心的一部分。 参考图、关键词、Prompt、色卡、生成的作品,每一次创作里真正有价值的东西,都可以也应该沉淀下来。 今天发现的一个关键词,可能是未来某张作品的起点。存下的一套配色,可以迁移到新的主题。 慢慢的,你留在 Viko 里的,就不只是一堆图和 Prompt 了。 它会变成一套真正属于你自己的,视觉创作资产库。 这也是我做到今天,越来越确定的一件事。 反推只是第一步。 找到一张图的美学基因,把它拆开、理解、重新组合,再把每次创作里有价值的东西留下来,让过去的积累继续参与未来的创作。 每一次创作,都应该让下一次创作变得更轻松。 所以! Viko 由 Chrome 插件和网页工作台两端组成,插件负责在你刷图的时候随手捕捉,工作台负责拆解和沉淀。插件在 Chrome 商店搜 Viko 就能装,网页端在 首发期间也肯定有福利送给大家,优惠码: VIKO20,首月直接8 折! 如果你平时也喜欢找图、研究风格、拆 Prompt、做二创,来试试。 看到好图,Viko 一下。

古一

238,311 次观看 • 1 个月前

兄弟们,我的开源项目 female-portrait-director 已经在 GitHub 拿到了 1.5K+ Stars 和 187 Forks,最近正愁缺一条产品宣传片,让没用过的人也能看明白它是干什么的。 正好试了下 Pexo Pexo,就用它给这个项目做了一条。 Pexo 是一款对话式 AI 视频工具。把项目资料和想法交给它,就能跟它一起定脚本、看分镜,再做成视频。配音、字幕、音乐和剪辑也都能一起处理,最后交付的是完整成片。哪里不满意,可以在同一个对话里继续改,不用自己在几个工具之间来回折腾。 我的项目做的是先锁定用户的要求、选择视觉路线,再把人物、服装、场景、镜头和光线组织成一个完整的画面。做宣传片时,光介绍这些功能还不够,得让人看到:一个模糊的想法交给它,最后能变成什么样。所以视频里哪些内容该留、用什么画面说明,都得先理清楚。 这次我把 GitHub 链接和项目素材一起交给 Pexo,让它先了解项目,再一起确定创意方向。脚本、分镜和静态风格帧都先看过,确认以后才开始生成第一版视频。 第一版出来,整体结构已经比较完整了,我又接着提了三版调整建议。最后剩下两个具体的地方要改:一个是替换 GitHub 首页截图,把项目的数据展示清楚;另一个是把原本分成两行的字幕调成一行,读起来更顺。 这两处我用的是 Pexo 的 Mark to Fix。暂停到对应画面,圈出要改的截图或字幕,在右侧弹出的批注框里写清楚要求,再提交修改。比如那句字幕,就直接指出是哪一句、希望排成一行,改完再看效果。前面聊过的项目背景,不用再解释一遍。 最后拿到了一条 35 秒的完整成片,旁白、字幕、音乐和动效都加好了,不用我再拿着几段素材回剪映里拼。片子还是来回改了几轮,但我能把精力放在“这里有没有讲清楚”上,具体怎么剪、怎么调,就交给 Pexo 处理。 有 AI 产品、GitHub 项目或者品牌内容需要做宣传视频的朋友,可以去 自己试一下。

李岳

68,088 次观看 • 8 天前

我把 AI 手绘视频,做成了一条可以本地持续生产的自动化流水线,有人之前已经在抖音跑出千赞 现在市面上 AI 视频工具很多,但大多数只解决“生成一条视频” 我更想解决的是: 怎么把一条视频,变成一套能稳定复用、持续产出的生产系统 所以我把声音克隆、文案拆解、分镜、插画、白板动画、字幕和最终合成,全部接到了一起 你只需要做 3 件事: · 上传一段 10–30 秒的参考声音 · 粘贴一段你想表达的文案 · 选择画面风格和视频形式 剩下的交给系统: · 自动克隆声音 · 自动理解文案并拆分内容结构 · 自动生成统一风格插画 · 自动绘制白板笔迹动画 · 自动生成字幕并合成 MP4 · 失败后可以从断点继续,不需要全部重来 这次新版还加了一条我很喜欢的能力: 动态信息图模式 它不再只是“白板画画”,而是会根据真实旁白的时间,自动把内容组织成动态 PPT / 知识卡片 比如对比、流程、因果、时间线、层级、总结这些内容,都会用不同版式呈现 而且画面元素会严格跟着旁白出现,不会提前抢话,也不会靠字数瞎估时间 我自己的方案是: 本地 TTS + AI 文案理解 + AI 插画生成 + 本地渲染 目标不是做一个“好玩的一键生成器”,而是让一台电脑可以持续稳定地生产内容 如果你手里有矩阵账号、知识类账号,或者长期需要把口播文案转成视频,这套流程应该会比较有用 项目已经全部开源,能跑的代码都放出来了: 功能演示我会继续更新 创作不易,如果你觉得这个方向有用,欢迎帮忙转发、关注,也欢迎直接拿去改

陈硕KAI

12,217 次观看 • 1 个月前