Loading video...

Video Failed to Load

Go Home

语音圈真的炸了,这个github开源黑科技把AI语音干到了离谱的程度,项目叫 VoxCPM2,已经揽获 22.9k star。 你用自然语言描述一个声音,它就能帮你生成出来。 不用找参考音频,也不需要任何样本,直接就能出效果。 更绝的是它的克隆能力。 随便找一段音频扔进去,它可以 1:1 复刻那个声音的音色、语气、情绪和节奏。 如果你再把原始文字稿也一起给它,连说话时的呼吸节奏、细微停顿都能还原。

52,134 views • 1 month ago •via X (Twitter)

0 Comments

No comments available

Comments from the original post will appear here

Related Videos

用 Codex 加 ChatCut,我终于能用自然语言丝滑剪辑我的视频了! 最近一直在研究这个 ChatCut 的 CodeX 插件 他们在自然语言视频作这个层面,绝对是第一梯队 最牛逼的几个点在于: 1. 全自然语言操控 可以用自然语言操作整个剪辑过程 你不需要去手动操作复杂的剪辑轨道,只需要把你的需求用大白话讲给它,它就会自动去调用工具进行剪辑 2. 剪辑与生成无缝集成 它把视频剪辑和生成功能全部集成到了同一个工具里 如果你在剪辑过程中需要某些素材,它会自动帮你去找,或者直接生成对应的素材 整个体验非常顺畅,效果挺屌的 3. 优秀的可视化交互 这是目前我见过交互体验最好的自然语言剪辑工具 安装好之后,左边是你跟 Codex 对话的区域,右边就是它的整个工作区 你可以实时、可视化地看到 Codex 是如何操作你的视频素材进行剪辑的 更爽的是,你还可以直接在右边的工作区里,对刚刚剪辑的视频进行精细化的微调和修改 这种交互方式真的已经非常接近我理想中自然语言剪辑了 不过他们目前也确实存在一些问题, 比如整体的处理速度还是比较慢,以及 Token 的消耗比较大 这也是现阶段的一个局限性,但我觉得未来一定会越来越好 如果对自然语言视频制作感兴趣的兄弟们,一定要去试一下这个插件! 官网链接如下:

来碗牛肉粉

12,698 views • 16 days ago

Distil-Whisper:让语音识别的速度提高 5.8 倍,参数减少 51%,准确度保持在 99%。 Whisper 在语音识别方面表现卓著,但是它有一个明显的缺点:训练出来的小模型支持的语言比较少,而大模型推理速度又很慢。如果你有海量的数据需要处理,或者对实时性要求略高,那使用 Whisper 可能会让你比较头疼。 你可以使用工程手段来加速推理,例如将语音分片后并发处理然后合并结果,但这里涉及到本地计算资源瓶颈的问题,以及合并分片时容错处理的问题,工程复杂度比较高。 《Distil-Whisper: Robust Knowledge Distillation via Large-Scale Pseudo Labelling 》, Whisper 的 Large-v2 model 生成了一系列的 soft targets(也就是概率分布),然后复制 Whisper 网络的第一层和最后一层解码器,最后生成了一个更小、更快效果更好的蒸馏模型 Distil-Whisper。论文数据写的是:速度提高了 5.8 倍,参数减少了 51%,准确度保持在 99%。 这个模型的效果之所以不错,主要还是得益于训练数据的完备,它结合了九个公开可用的语音识别数据集,合并后包含 21170 小时的语音数据,涵盖超过 18260 名说话者和 10 个不同的领域;自从 Whisper 大力出奇迹(它从互联网爬取了 68w 小时的数据,未公开)以后,相信后续语音领域的论文都会配置更庞大的数据集。 Distil-Whisper 目前开源在 Hugging Face 上,模型地址: Demo: Demo 会把模型下载到本地,然后通过 WebGPU 直接在网页上跑起来,测试了下效果,还是挺不错的。 目前仅支持英文,如果想让它支持中文,需要使用同样海量的中文语料数据,重新做一次知识蒸馏,但我觉得即便是这样做,效果也不一定好,因为 Whisper 本身对中文、韩语等支持就不太优秀,这个信息可以从 Whisper 的论文中找到数据支撑。 下面这个视频是 Whisper 和 Distil-Whisper 的对比效果:

Barret李靖

124,227 views • 2 years ago