Загрузка видео...
Не удалось загрузить видео
Meta刚发了自家第一款实时音频感知模型:Muse Voice Transcribe,Meta AI眼镜的耳朵 它有几个核心能力,流式原生架构、80ms流式、AI自己决定等多久再写,通过强化学习让模型实现了自适应延迟,就是简单的词快速输出,难识别的词多听一会儿 最终效果,3.1% WER、0.16秒延迟,目前第一 第二个说话人分离,能分清20个以上的说话人,每个人说话前都会标注Speaker A、Speaker B等,原生支持超过1小时的音频,这个比较就适用于会议、播客等长时间场景 第三,能听懂中英混说,一句话里中英文无缝切换,转写流畅 还能利用你的个人上下文来提高识别准确率,比如说你常去的地点、你领域的专业关键词 #AI音频模型 #MuseVoiceTranscribe #实时音频模型
11,034 просмотров • 2 дней назад •via X (Twitter)
Комментарии: 0
Нет доступных комментариев
Здесь появятся комментарии из оригинального поста
