左海有个洲's banner
左海有个洲's profile picture

左海有个洲

@heizolshao1,581 subscribers

💻 资深程序员|AI 深度玩家 🚀 分享 AI、科技、副业玩法 💰 用技术持续创造长期价值

Shorts

最近中文推里,Rachel🥥 的数字人skill 太火了 如果你也想使用这个Skill, 算了一遍成本才发现,从声音克隆、配音到人物视频生成,每一层都在收费。10 秒视频要花 $1 左右。 本着独立开发者精神,能省则省的思路。 我就在想有没有本机部署模型的平替方案? 今天花了 4 个小时,总算找到了。 声音部分:改成本地运行 Qwen3-TTS 模型,用一段自己的录音生成后续口播 wav文件。 视频目前仍然使用 HeyGen: 但我已经找到代替方案 LongCat-Video-Avatar 1.5 模型(待测试)。 我发现在调用 HeyGen 花$0.6 后,生成的口播视频,缺少字幕,这就成了半成品。 无意中发现好友 Jasper Wei 的 JPW-Live-Cut 给了我新的启发。我复用了他的 Remotion 字幕思路,单独做了一条本地字幕流水线,让它支持任意长度的普通口播视频。 现在整条流程已经变成: 本人参考声音 → 本地 Qwen3-TTS 生成口播 → 本地 ASR 检查 → HeyGen 生成人物视频 → Remotion 自动添加字幕 → 人工确认最终成片 下一步很明确:用LongCat-Video-Avatar 1.5 替代 HeyGen 的方案,把人物视频生成这笔费用也压下来。 让花费$0 也能做数字人。 成品效果见视频。

最近中文推里,Rachel🥥 的数字人skill 太火了 如果你也想使用这个Skill, 算了一遍成本才发现,从声音克隆、配音到人物视频生成,每一层都在收费。10 秒视频要花 $1 左右。 本着独立开发者精神,能省则省的思路。 我就在想有没有本机部署模型的平替方案? 今天花了 4 个小时,总算找到了。 声音部分:改成本地运行 Qwen3-TTS 模型,用一段自己的录音生成后续口播 wav文件。 视频目前仍然使用 HeyGen: 但我已经找到代替方案 LongCat-Video-Avatar 1.5 模型(待测试)。 我发现在调用 HeyGen 花$0.6 后,生成的口播视频,缺少字幕,这就成了半成品。 无意中发现好友 Jasper Wei 的 JPW-Live-Cut 给了我新的启发。我复用了他的 Remotion 字幕思路,单独做了一条本地字幕流水线,让它支持任意长度的普通口播视频。 现在整条流程已经变成: 本人参考声音 → 本地 Qwen3-TTS 生成口播 → 本地 ASR 检查 → HeyGen 生成人物视频 → Remotion 自动添加字幕 → 人工确认最终成片 下一步很明确:用LongCat-Video-Avatar 1.5 替代 HeyGen 的方案,把人物视频生成这笔费用也压下来。 让花费$0 也能做数字人。 成品效果见视频。

19,480 views

Videos

No more content to load