Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

阿里发布 Qwen3.8-LiveTranslate实时语音翻译模型: 一边听、一边译、一边说 这次升级集中在四项能力: 分清谁在说话:流式区分多位说话人,并让译文语音尽量保留各自音色; 原文译文同步出现:同一条数据流同时返回源语言识别结果与目标语言译文,便于字幕核对与内容整理; 用前文和画面消歧:结合长上下文与静态图像帧,处理指代、专名和同音词; 减少流式等待:把音频和文字交替放进同一条处理流,复用已经听过的音频和已经生成的译文;在 FLEURS 测试中,译文平均落后原话的时间从上一代的 2.8 秒降到 2.3 秒。 种支持与覆盖范围 系统对不同语种提供三种能力: 音频输入 · 60 种:可以把这些语言作为源语音送入模型; 文字输出 · 60 种:可以返回这些目标语言的翻译文本; 语音输出 · 29 种:只有这个子集可以进一步合成目标语言语音。

28,548 Aufrufe • vor 9 Tagen •via X (Twitter)

13 Kommentare

Profilbild von 小互
小互vor 9 Tagen

在多人轮流发言或交替对话时,模型会用 spk1、spk2、spk3 这样的标签区分每句话是谁说的,并让对应的译文语音保留各自的音色。

Profilbild von 小互
小互vor 9 Tagen

当声音里出现同音词,仅靠前后文仍难以判断时,模型还可以参考摄像头画面。

Profilbild von 小互
小互vor 9 Tagen

Qwen3.8-LiveTranslate 改用 Thinker–Talker 双模块。 底层的 Hybrid MoE 是一种“按任务选择部分专家模块参与计算”的架构;Interleave 则表示音频、原文和译文不再分批排队处理,而是按时间顺序交替进入同一条处理流。 详细内容:

Profilbild von Xian | 弦
Xian | 弦vor 9 Tagen

还不睡,熬夜不好

Profilbild von AI Mastery Guide
AI Mastery Guidevor 9 Tagen

Keeping each speaker's voice is wild

Profilbild von 大熊
大熊vor 9 Tagen

16GM4可以跑不 整个dmg出来玩玩

Profilbild von 景哥|AI落地与智能体实践
景哥|AI落地与智能体实践vor 9 Tagen

2.3 秒的流式延迟、多音色保留与多模态消歧。Qwen3.8-LiveTranslate 正在把实时语音翻译推向真正的工程可用。

Profilbild von 何晚
何晚vor 9 Tagen

把流式延迟压到 2.3 秒确实很强,不过更让人好奇的是多个人交叉抢话时的音色稳定性。 同一条流里结合前文和画面消歧很实用,但在语速极快或者夹杂技术缩写的时候,模型会频繁撤回重翻吗? 要是跨境会议里能做到声线不串、专有名词不乱飘,很多外包翻译岗位可能真得承压了。

Profilbild von ruigege
ruigegevor 9 Tagen

我是一个听力残疾人。现在用的是手机自带的实时字幕功能和人交流。这个功能是不是意味着以后和很多人聊天的时候,它能够通过音色自动识别是某个人讲话?

Profilbild von 松鼠的松
松鼠的松vor 9 Tagen

开源了吗

Profilbild von 聾
聾vor 9 Tagen

评论区怎么还没有人有大胆的想法!

Profilbild von JasonC
JasonCvor 9 Tagen

2.8 秒掉到 2.3 秒,是译文开口还是整句翻完?切说话人的时候音色跟不跟得上。

Profilbild von Crio Songo
Crio Songovor 9 Tagen

这个流式实时翻译的优化点挺贴合实际使用场景的,延迟降了不少,跨语言同传应该会顺畅很多。

Ähnliche Videos