Loading video...

Video Failed to Load

Go Home

🎉 前两天挖到的基于 Qwen3-4B 微调的 ASR 语音识别模型,今天终于有时间本地部署实测了! 直接拿它和行业标杆 Whisper 做了一次全方位硬核对比 具体高能表现看录屏👇 主打一个低门槛:16G 显存就能直接本地部署,对个人开发者极其友好 用 40 亿参数大模型来做语音识别,完全是降维打击,直接让传统同行无路可走! 但这只是开始。语音识别的终局绝非“听音辨字”,而是“端到端多模态理解”的进化 语音识别的终局绝不是单纯的“听音辩字”,而是向着“端到端多模态理解”演进 未来,声音就是大模型的天然输入口,ASR 会无处不在,却又隐于无形 听到声音的同时就在理解世界,这才是真正的 AI 2.0 时代! 以上。

27,192 views • 9 days ago •via X (Twitter)

0 Comments

No comments available

Comments from the original post will appear here

Related Videos

万万没想到奥特曼昨夜放了大招,有一种王者归来的气势。原来我一直以为 OpenAI 的 Whisper 已经到了语音识别的天花板了。看来是我认知太浅薄了。 由于老婆就是川渝那边的,方言的味道绝对十足。如果走在街上,加上外界环境的嘈杂声,我之前用的 Whisper 测试过简直就是个瞎子,识别出来叽里呱啦的一大串乱七八糟的字符真的有点神奇。 这两天无意间看到了这个开源的模型,Hojo-ASR-Multi-V1,据说是语音识别领域的新星。 🔥 Hugging Face Open ASR Leaderboard 多语言榜全球第 7,开源多语言 ASR 第 1。 🎉五语种平均 WER 3.54%,模型权重开放、评测公开、结果可复现。 😄同时支持普通话、英语、粤语和四川话等多语言、多方言识别。 特意找来测试了一下,发现真的有意思。 更有意思的是 Hojo 的处理过程:声音 → Qwen3-Omni 音频编码器听懂声音 → Adapter 转换特征 → Qwen3-4B 生成文字。 通俗一点的讲就是:声音进来 → 音频编码器先“听懂”声音 → Adapter 把声音信息翻译成大模型能理解的格式 → Qwen3-4B 再把它变成文字。 而 Whisper:声音进来 → 转成频谱图 → Whisper 编码器提取声音信息 → Whisper 解码器直接生成文字 两者对比就是Whisper 的重点是 听声音 → 写文字,而 Hojo 则更偏向 听声音 → 理解声音 → 再根据理解生成文字。 所以最后我在本机做了一个测试结果还是非常不错的。 先解释一个百分比,CER = Character Error Rate,字符错误率,百分比越小越好。 然后可以看看我的视频 hojo 和 whisper的对比,做了三个例子,川渝话、广东话、普通话。 川渝话:hojo CER= 0%, whisper CER=42.9% 广东话:hojo CER=18.8%, whisper CER=43.8% 普通话:hojo CER=16.7%, whisper CER=25.0% 应该说 hojo这一套效果还是非常不错的。 最后附上他们的开源模型,有兴趣的可以本地部署玩玩看:

AI少年

93,688 views • 9 days ago

大家默认 奥特曼的Whisper 是 语音识别(ASR) 天花板。 我用四川话测了一句:巴适。 Whisper 听成了八式,它从没学过四川话。 同一批音频,Hojo-ASR-Multi-V1:错误率0.0%。 接着,我给了它们一段成都街头的环境音,全程没有一个人说话。 · Whisper 吐出 100 个 嗨 · Hojo 吐出 5 个字符 两个都幻觉了,但一个是 100 字,一个是 5 字。嘈杂街头声音解码,是常用的场景。 我用两个模型做了详细评测。最有意思的是 Hojo 的底座 —— 语音编码器来自 Qwen3-Omni-30B,语言解码器是 Qwen3-4B。 🚀一个文本大模型,凭什么能做语音识别? 因为 ASR 从来就是两半:声学 + 语言。 「bā shì」这个音,在波形里根本分不出是「巴适」还是「八式」—— 声音里没有这个信息。能定夺的只有语言知识:哪个词真的存在、在这个语境里说得通。 Qwen3-4B 读过整个中文互联网,知道「巴适」是个四川话词。 🔥接法很巧:训练一个适配器,把音频编码成2560维向量,刚好Qwen3-4B刚好接受2560 维。 两个数字一对上,Qwen 就以为自己在读词,其实在听声音。 所以这不是从头训语音识别模型,而是后训练:拿 Qwen3-4B 当初始化权重,连同音频编码器一起全参数微调。 我把它的解码器和原版 Qwen3-4B 逐层比对过,每一层都有变化。所以不是白嫖 Qwen 的语言知识,避免了从零预训练语言能力。这条路叫 Encoder-Adapter-LLM。 最后还有一个牛逼的点: Open ASR Leaderboard全球第 7,开源多语言 ASR 第 1。 五语种平均 WER 3.54%,而且权重开放、评测公开、结果可复现。 现已支持四川话、广东话小语种。 Apache 2.0 开源。

实践哥 Li

46,958 views • 11 days ago