Loading video...

Video Failed to Load

Go Home

《我用 Codex 做数字人视频,2 分钟到底花多少钱?》💰 上一期分享了完整的数字人口播制作流程,这一期直接公开实际制作成本。 主播图片通过 Codex 调用 GPT Image 2 生成;音色可以使用 Gemini TTS、MiniMax 或 ElevenLabs;文案也可以直接在 Codex 中完成。整套流程真正的成本大头,主要集中在视频生成环节。 上一期使用 Seedance 2.0 生成约两分钟的视频,共消耗 2000 多积分,成本大约一百多元。如果预算有限,也可以尝试 MiniMax H3 等成本更低的模型。 你觉得这样的数字人制作成本可以接受吗?欢迎在评论区交流。

20,423 views • 1 month ago •via X (Twitter)

0 Comments

No comments available

Comments from the original post will appear here

Related Videos

今天我花了6 个小时,把数字人做成了可上市的产品。 昨天数字人工具做出来后,我在反思 2 个问题: 1. HeyGen 的成本太高了每 10 秒 $0.6,一条 1 分钟的口播就是 $3.6。 2. 数字人工具有了,内容从哪里来?内容才是王。 在好友 0xMomo 的思路启发下,我把 GPT Researcher 接到了这条流程前面。 给它一个具体话题,先查资料、核验事实,再整理出适合口播的脚本。 我先尝试了完整的深度调研流程,测试下来发现日常生产内容太慢。 后来把 GPT Researcher拆分,只用他的 DuckDuckGo 检索器,做成功一个快速调研的 API 接口: 输入一个话题,自动拆分查询、并行搜索、过滤低质量来源,最后生成证据卡、3 版口播脚本和真实网页截图。 脚本来源解决后,我又调整了视频结构。 数字人只负责开场和结尾,中间用 B-roll 插入真实新闻、图表和资料截图。 按首尾合计约 30 秒计算,一条 1 分钟视频的 HeyGen 成本可以从 $3.6 降到约 $1.8。字幕、封面、B-roll 和最终合成都在本地完成。 现在一条完整的口播流程变成了: 具体话题 → GPT Researcher 里的 DuckDuckGo 快速调研与事实核验 → 生成 3 版证据脚本 → Qwen3-TTS 本地生成语音和试听 MP3 → 本地 ASR 检查 → 人工确认脚本、声音和 HeyGen 成本 → HeyGen 只生成数字人开场与结尾 → B-Roll 中间插入真实新闻和资料截图 → Remotion 添加字幕、封面和关注片尾 → 输出完整 MP4 我还把整套流程封装成了一个 Skill: $topic-to-digital-human-video(skill 稍后公布在评论区里) 只需要你提交一个话题, 比如:韩国股灾为什么这么严重吗? 它就会自动完成调研、事实核验、脚本、语音和素材整理。 在调用 HeyGen 花钱之前,流程会停下来让你再次确认。 接下来继续测试 ninglon 好友的建议:用cosyvoice做有情绪的声音克隆,用avatar,加LTX2.3对嘴型代替 heygen,他说他跑通了。 我一定要把 heygen 价格打下来。 这个话题的成片见视频。

左海

14,706 views • 2 months ago