Загрузка видео...
Не удалось загрузить видео
阿里发布 Qwen3.8-LiveTranslate实时语音翻译模型: 一边听、一边译、一边说 这次升级集中在四项能力: 分清谁在说话:流式区分多位说话人,并让译文语音尽量保留各自音色; 原文译文同步出现:同一条数据流同时返回源语言识别结果与目标语言译文,便于字幕核对与内容整理; 用前文和画面消歧:结合长上下文与静态图像帧,处理指代、专名和同音词; 减少流式等待:把音频和文字交替放进同一条处理流,复用已经听过的音频和已经生成的译文;在 FLEURS 测试中,译文平均落后原话的时间从上一代的 2.8 秒降到 2.3 秒。 种支持与覆盖范围 系统对不同语种提供三种能力: 音频输入 · 60 种:可以把这些语言作为源语音送入模型; 文字输出 · 60 种:可以返回这些目标语言的翻译文本; 语音输出 · 29 种:只有这个子集可以进一步合成目标语言语音。
28,548 просмотров • 9 дней назад •via X (Twitter)
Комментарии: 13

小互9 дней назад
在多人轮流发言或交替对话时,模型会用 spk1、spk2、spk3 这样的标签区分每句话是谁说的,并让对应的译文语音保留各自的音色。

小互9 дней назад
当声音里出现同音词,仅靠前后文仍难以判断时,模型还可以参考摄像头画面。

小互9 дней назад
Qwen3.8-LiveTranslate 改用 Thinker–Talker 双模块。 底层的 Hybrid MoE 是一种“按任务选择部分专家模块参与计算”的架构;Interleave 则表示音频、原文和译文不再分批排队处理,而是按时间顺序交替进入同一条处理流。 详细内容:

Xian | 弦9 дней назад
还不睡,熬夜不好

AI Mastery Guide8 дней назад
Keeping each speaker's voice is wild

大熊8 дней назад
16GM4可以跑不 整个dmg出来玩玩

景哥|AI落地与智能体实践9 дней назад
2.3 秒的流式延迟、多音色保留与多模态消歧。Qwen3.8-LiveTranslate 正在把实时语音翻译推向真正的工程可用。

何晚9 дней назад
把流式延迟压到 2.3 秒确实很强,不过更让人好奇的是多个人交叉抢话时的音色稳定性。 同一条流里结合前文和画面消歧很实用,但在语速极快或者夹杂技术缩写的时候,模型会频繁撤回重翻吗? 要是跨境会议里能做到声线不串、专有名词不乱飘,很多外包翻译岗位可能真得承压了。

ruigege8 дней назад
我是一个听力残疾人。现在用的是手机自带的实时字幕功能和人交流。这个功能是不是意味着以后和很多人聊天的时候,它能够通过音色自动识别是某个人讲话?

松鼠的松8 дней назад
开源了吗

聾8 дней назад
评论区怎么还没有人有大胆的想法!

JasonC8 дней назад
2.8 秒掉到 2.3 秒,是译文开口还是整句翻完?切说话人的时候音色跟不跟得上。

Crio Songo8 дней назад
这个流式实时翻译的优化点挺贴合实际使用场景的,延迟降了不少,跨语言同传应该会顺畅很多。
