Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

英伟达最新开源的一款ASR:Nemotron Speech ASR,专攻低延迟实时语音智能体场景,多人同时对话不爆延迟 单句最终转录锁定只需24ms,端到端全程<500ms,长语音不会累加等待时间 核心是其在FastConformer架构里加了一套缓存感知机制,已经算过的语音特征全部缓存在显存,不再二次编码 新音频只算增量,帧级复用。好比说,以前每翻一页书都要把前面几页重读一遍,现在直接夹书签只读新段落 延迟模式可动态配置,80、160、560毫秒、1.12 秒等,无需重新训练,可根据应用需求灵活选择来平衡延迟和WER 基于Nemotron Speech ASR还给了一个AI语音助手构建示例,LLM用的Nemotron 3 Nano 30B,TTS是Magpie 在此配置下,Nemotron Speech ASR实现了最终转录的中位时间为24毫秒,且不受话语长度影响,长音频片段与短音频片段一样可以快速完成转录 #ASR #NemotronSpeechASR #AI语音助手

24,216 Aufrufe • vor 8 Monaten •via X (Twitter)

7 Kommentare

Profilbild von AIGCLINK
AIGCLINKvor 8 Monaten

语音助手代码: Nemotron Speech ASR:

Profilbild von Vincent
Vincentvor 8 Monaten

在 T4 这种老旧推理卡上跑了一下 Demo,FastConformer 的吞吐量确实惊人。单卡 fp16 精度下,同时维持 200 路并发流,显存占用只增加了 4GB 左右,RTF 稳定在 0.003。相比之下,Whisper-large-v3 即便用了 Faster-Whisper 加速,在同等并发下如果不做激进的 KV Cache 量化,显存早就 OOM 了。不过要注意,Nemotron 在处理非英语的长尾语种时,幻觉率比 Whisper 高出约 15%,低延迟是有精度代价的。

Profilbild von add
addvor 8 Monaten

@readwise save thread

Profilbild von 𝐀𝐧𝐝𝐲
𝐀𝐧𝐝𝐲vor 8 Monaten

24ms,是真不给同行留活路啊

Profilbild von Robin
Robinvor 8 Monaten

@grok 核查一下

Profilbild von SIM|独立开发
SIM|独立开发vor 8 Monaten

so cool

Profilbild von OSDev
OSDevvor 8 Monaten

rst @readwise save thread

Ähnliche Videos

阿里刚刚一口气发了五款语音模型:Qwen-Audio-3.1系列,并全线降价,ASR降95%、Realtime降85%、TTS降70% 同时覆盖理解、生成、创作、实时交互的完整链条。阿里这次直接打出了语音模型的三板斧:能力全栈化、价格断崖下探、语音被推到Agent/硬件入口位置 它这次的Realtime不是只会聊天,是全双工可打断、能识别情绪、能多语言切换,还能调用工具,这就会把语音从搜索式问答推向事务式对话 实时语音从“功能”变成“交互入口”,直接冲击客服、助手以及硬件,AI眼镜、办公Agent、硬件结合等无屏化任务场景或将迎来一波热潮 ASR:能转写30种语言+16种中文方言、原生转写润色(去语气词/重复、语义重组)、分角色转写(谁在什么时候说了什么,带时间戳,支持插话/重叠语音)、流式低延迟(首字约160毫秒) ASR-Next:从“语音转文字”扩展到“理解整个音频”,能听出情绪、环境声、机械声,理解事件时间、进行音频问答 TTS:重点是同一音色跨语言/方言不变味,还能控制情绪和语速 TTS-Next:这个比较狠,从“配音”升级到“做完整音频作品”,一次生成人声、音效、环境音,多角色音色一致、全程不变声;48kHz输出 直接瞄准播客、有声书、影视、游戏、广告等场景 Realtime:全双工,可同时说和听,可打断、能共情、能无缝切换语言、对话中能调用Agent工具完成任务 #阿里语音模型 #QwenAudio

AIGCLINK

16,074 Aufrufe • vor 9 Tagen