Video wird geladen...
Video konnte nicht geladen werden
英伟达最新开源的一款ASR:Nemotron Speech ASR,专攻低延迟实时语音智能体场景,多人同时对话不爆延迟 单句最终转录锁定只需24ms,端到端全程<500ms,长语音不会累加等待时间 核心是其在FastConformer架构里加了一套缓存感知机制,已经算过的语音特征全部缓存在显存,不再二次编码 新音频只算增量,帧级复用。好比说,以前每翻一页书都要把前面几页重读一遍,现在直接夹书签只读新段落 延迟模式可动态配置,80、160、560毫秒、1.12 秒等,无需重新训练,可根据应用需求灵活选择来平衡延迟和WER 基于Nemotron Speech ASR还给了一个AI语音助手构建示例,LLM用的Nemotron 3 Nano 30B,TTS是Magpie 在此配置下,Nemotron Speech ASR实现了最终转录的中位时间为24毫秒,且不受话语长度影响,长音频片段与短音频片段一样可以快速完成转录 #ASR #NemotronSpeechASR #AI语音助手
24,216 Aufrufe • vor 8 Monaten •via X (Twitter)
7 Kommentare

AIGCLINKvor 8 Monaten
语音助手代码: Nemotron Speech ASR:

Vincentvor 8 Monaten
在 T4 这种老旧推理卡上跑了一下 Demo,FastConformer 的吞吐量确实惊人。单卡 fp16 精度下,同时维持 200 路并发流,显存占用只增加了 4GB 左右,RTF 稳定在 0.003。相比之下,Whisper-large-v3 即便用了 Faster-Whisper 加速,在同等并发下如果不做激进的 KV Cache 量化,显存早就 OOM 了。不过要注意,Nemotron 在处理非英语的长尾语种时,幻觉率比 Whisper 高出约 15%,低延迟是有精度代价的。

addvor 8 Monaten
@readwise save thread

𝐀𝐧𝐝𝐲vor 8 Monaten
24ms,是真不给同行留活路啊

Robinvor 8 Monaten
@grok 核查一下

SIM|独立开发vor 8 Monaten
so cool

OSDevvor 8 Monaten
rst @readwise save thread
