正在加载视频...

视频加载失败

有道重磅开源!子曰4.0 TTS:告别生硬机器音,跨语言口播也有灵魂了! 刚亲测了网易有道刚刚开源的 Confucius4-TTS(子曰4.0),效果真的很惊喜。 以前做跨语言口播,最头疼的就是:翻译完之后,机器音又干又硬,音色变了、语气没了、情绪也丢了,听着完全没有灵魂,像另一个人在念稿。 而子曰4.0最打动我的地方是翻译和声音迁移几乎同步完成。你只需要给一段参考音频,它就能把原声的音色、语气和情绪自然带到另一种语言里。 听起来不再是冰冷的机器配音,而是原角色换了一种语言在自然口播,那种熟悉的感觉和情感起伏都保留得非常明显。 特别厉害的地方在于: - 14种语言随便切换,几乎听不出口音,一把声音走天下 音色、语气、情绪同步迁移,角色灵魂不丢 - 真正零样本克隆,只需一段参考音频即可 - 完全开源(Apache协议),支持本地部署 + 二次训练,随便玩 对内容创作者来说,这波真的实用:视频出海、本地化、二创、多语言播客、短视频等场景,过去最痛苦的配音环节,现在门槛大幅降低。 终于可以告别生硬机器音,让跨语言口播也有温度、有灵魂。

21,036 次观看 • 3 个月前 •via X (Twitter)

0 条评论

暂无评论

原始帖子的评论将显示在这里

相关视频

阿里刚刚一口气发了五款语音模型:Qwen-Audio-3.1系列,并全线降价,ASR降95%、Realtime降85%、TTS降70% 同时覆盖理解、生成、创作、实时交互的完整链条。阿里这次直接打出了语音模型的三板斧:能力全栈化、价格断崖下探、语音被推到Agent/硬件入口位置 它这次的Realtime不是只会聊天,是全双工可打断、能识别情绪、能多语言切换,还能调用工具,这就会把语音从搜索式问答推向事务式对话 实时语音从“功能”变成“交互入口”,直接冲击客服、助手以及硬件,AI眼镜、办公Agent、硬件结合等无屏化任务场景或将迎来一波热潮 ASR:能转写30种语言+16种中文方言、原生转写润色(去语气词/重复、语义重组)、分角色转写(谁在什么时候说了什么,带时间戳,支持插话/重叠语音)、流式低延迟(首字约160毫秒) ASR-Next:从“语音转文字”扩展到“理解整个音频”,能听出情绪、环境声、机械声,理解事件时间、进行音频问答 TTS:重点是同一音色跨语言/方言不变味,还能控制情绪和语速 TTS-Next:这个比较狠,从“配音”升级到“做完整音频作品”,一次生成人声、音效、环境音,多角色音色一致、全程不变声;48kHz输出 直接瞄准播客、有声书、影视、游戏、广告等场景 Realtime:全双工,可同时说和听,可打断、能共情、能无缝切换语言、对话中能调用Agent工具完成任务 #阿里语音模型 #QwenAudio

AIGCLINK

15,825 次观看 • 7 天前