Загрузка видео...

Не удалось загрузить видео

На главную

兄弟们,这个全新的语音模型很厉害 已经无法分辨了 Sesame: “跨越语音“恐怖谷” ,像真人说话一样的语音模型 当人工合成的语音接近真实人声但仍然存在微小差异时,人类会感到奇怪或不适,这就是所谓的“恐怖谷效应”。 Sesame 公司展示了其最新的语音合成模型CSM, 它在个性、记忆、表达能力和恰当性上表现出了非常惊人的能力。

132,361 просмотров • 1 год назад •via X (Twitter)

Комментарии: 11

Фото профиля 小互
小互1 год назад

Sesame公布了其最新的研究成果并提供了在线演示,详细信息:

Фото профиля 小互
小互1 год назад

在线体验:

Фото профиля Breeze
Breeze1 год назад

试了,是个话痨,一直不停说不停说,连续两遍让它speek slowly不起作用,再连续两遍让它be quiet才安静下来。一对话又说个不停。

Фото профиля Zhao Xin 赵昕
Zhao Xin 赵昕1 год назад

请问,这是哪里的公司,上市了吗

Фото профиля Tomorrow
Tomorrow1 год назад

豆包也有这个效果

Фото профиля Dat
Dat1 год назад

有点厉害

Фото профиля Gmsin
Gmsin1 год назад

真牛逼这个

Фото профиля JASON
JASON1 год назад

试了五分钟,无限接近真实人声,能够通过语气表达情感,太棒了。

Фото профиля Jelly Bomb
Jelly Bomb1 год назад

太可怕,感觉像跟真人聊天一样,而且还是那种特别开朗,能量充沛的人😃

Фото профиля bitsun.eth
bitsun.eth1 год назад

可以训练声音吗

Фото профиля AssemblyAI
AssemblyAI1 год назад

Announcing: Our most advanced speech-to-text model goes beyond accuracy to capture the real-world complexity of human conversation and deliver reliable, source-of-truth audio data. Explore Universal-2 updates 👇

Похожие видео

细节的 TTS 技术 Seed-TTS,制作出来的有声书可能要让喜马拉雅的很多主播失业了!支持多种语言。 目前还没看到项目代码或者测试地址,只有论文: 摘要 我们介绍了Seed-TTS,这是一系列大规模自回归文本转语音(TTS)模型,能够生成几乎与人类语音无法区分的语音。Seed-TTS作为语音生成的基础模型,在语音上下文学习中表现出色,在说话者相似性和自然性方面的表现与真实人类语音在客观和主观评估中相匹配。通过微调,我们在这些指标上获得了更高的主观评分。Seed-TTS在各种语音属性(如情感)上提供了卓越的可控性,并且能够为自然环境中的说话者生成高度富有表现力和多样化的语音。此外,我们提出了一种用于语音因子化的自蒸馏方法,即通过让模型自行学习和改进的方式来提高性能,以及一种增强模型鲁棒性、说话者相似性和可控性的强化学习方法。我们还展示了Seed-TTS模型的非自回归(NAR)变体,名为Seed-TTSDiT,它采用完全基于扩散的架构。与以前的基于NAR的TTS系统不同,Seed-TTSDiT不依赖于预估的音素持续时间,而是通过端到端处理进行语音生成。我们证明了这种变体在客观和主观评估中达到了与基于语言模型的变体相当的性能,并展示了其在语音编辑中的有效性。

宝玉

67,886 просмотров • 2 лет назад