正在加载视频...

视频加载失败

大家默认 奥特曼的Whisper 是 语音识别(ASR) 天花板。 我用四川话测了一句:巴适。 Whisper 听成了八式,它从没学过四川话。 同一批音频,Hojo-ASR-Multi-V1:错误率0.0%。 接着,我给了它们一段成都街头的环境音,全程没有一个人说话。 · Whisper 吐出 100 个 嗨 · Hojo 吐出 5 个字符 两个都幻觉了,但一个是 100 字,一个是 5 字。嘈杂街头声音解码,是常用的场景。 我用两个模型做了详细评测。最有意思的是 Hojo 的底座 —— 语音编码器来自 Qwen3-Omni-30B,语言解码器是 Qwen3-4B。 🚀一个文本大模型,凭什么能做语音识别? 因为 ASR 从来就是两半:声学 + 语言。 「bā shì」这个音,在波形里根本分不出是「巴适」还是「八式」—— 声音里没有这个信息。能定夺的只有语言知识:哪个词真的存在、在这个语境里说得通。 Qwen3-4B 读过整个中文互联网,知道「巴适」是个四川话词。 🔥接法很巧:训练一个适配器,把音频编码成2560维向量,刚好Qwen3-4B刚好接受2560 维。 两个数字一对上,Qwen 就以为自己在读词,其实在听声音。 所以这不是从头训语音识别模型,而是后训练:拿...

46,958 次观看 • 11 天前 •via X (Twitter)

53 条评论

Evan.Z 的头像
Evan.Z11 天前

「声学只负责把音提出来,语言负责选哪个词说得通」这个拆法我认同。但反过来也有风险:语言模型太强时,容易把含糊的音「脑补」成它熟悉的词,街头幻觉五个字可能就是这种残影。方言支持如果主要靠 LLM 先验而不是足量方言声学数据,遇到更土、更连读的成都话会不会又掉回去?

实践哥 Li 的头像
实践哥 Li11 天前

专业 👍

Titus Hoon 的头像
Titus Hoon10 天前

考虑一下国产,在方言方面已经很能打了

实践哥 Li 的头像
实践哥 Li10 天前

感谢分享,我会研究一下。

WikiDB 的头像
WikiDB11 天前

另一个类似架构的模型,在iPhone上已经可以跑了,还能识别说话人

我真的没有拼多多 的头像
我真的没有拼多多10 天前

牛逼!

瓜哥玩AI 的头像
瓜哥玩AI11 天前

我也要试试 whisper中文的确差点意思

实践哥 Li 的头像
实践哥 Li11 天前

whisper 要挂个 LLm 用,用后就不需要了

前端哥Liam 的头像
前端哥Liam10 天前

这个真挺牛逼的,正好需要

实践哥 Li 的头像
实践哥 Li10 天前

Whisper 点 CPP 正式下岗。只要你硬件能跑起来。

Tim Wu 的头像
Tim Wu10 天前

很有趣的思路 雖然比起一般whisper 參數量大了兩倍,但如果能達到高準度倒是不錯

实践哥 Li 的头像
实践哥 Li10 天前

是的,whisper 的生态太好了。 做到前沿就会有生态

yishan 的头像
yishan11 天前

福建上千种方言,以后急需这种小语种模型

实践哥 Li 的头像
实践哥 Li11 天前

网站有没有开源数据集 可以给这个官方发个 request 让他支持所有福建方言

耳朵 的头像
耳朵10 天前

奥特曼的太老了,中文 语音识别天花板毫无疑问是豆包 seed

实践哥 Li 的头像
实践哥 Li10 天前

豆姐的ASR 也是用大模型路线,不过它是闭源模型里的。

WEEX AI Labs 的头像
WEEX AI Labs10 天前

四川人说了句巴适,Whisper听完开始表演第八套广播体操!

实践哥 Li 的头像
实践哥 Li10 天前

广播体操第八式?

波妞PONYO 的头像
波妞PONYO11 天前

讲透了“语音识别本质是声学+语言”的底层逻辑👍

实践哥 Li 的头像
实践哥 Li10 天前

老师是专业的,很多线上聊天模型,比如豆包,都是直接接收语音的,并没有做一次文字识别。

波妞PONYO 的头像
波妞PONYO10 天前

还要跟着实践哥学习最新前沿模型知识

一辈子放牛 Cowboy 的头像
一辈子放牛 Cowboy11 天前

必须手工点赞👍

Main CaseZ·美學 的头像
Main CaseZ·美學11 天前

我可以申请我本地语种测试吗 多种方言 没问题的

实践哥 Li 的头像
实践哥 Li11 天前

哈哈 那要给项目提要求 你也可以自己练一个

荒野饲养员 的头像
荒野饲养员11 天前

等下来测试一下,好用就留下了

实践哥 Li 的头像
实践哥 Li11 天前

来测测 比较简单

赛博CK 的头像
赛博CK10 天前

Whisper is so 2022

JZen 的头像
JZen10 天前

主流语言用 whisper 确实已经没有明显优势了,但 whisper 生态好,支持的语言多,在很多小语种 asr 开源模型中, whisper 依旧是天花板级别的存在

Lonely 的头像
Lonely11 天前

ASR 赛道要卷起来了

实践哥 Li 的头像
实践哥 Li11 天前

挺好的,优惠了我们开发者

Steve 的头像
Steve10 天前

昨天给qwen 3.8 27B uncensored 配上了 qwen3-tts 感觉有点拉

实践哥 Li 的头像
实践哥 Li10 天前

你想干什么 😂

Steve 的头像
Steve10 天前

就是给自己私人模型小助理加个声音 语音效率毕竟是最高的😜

实践哥 Li 的头像
实践哥 Li10 天前

哥,你太会玩了,要不要再搞个 H3 破解版

Steve 的头像
Steve10 天前

哈哈 不用了 一个嘴严聪明会深度思考的小秘就行了 其他的 活人可以代劳

ChlorampEY 的头像
ChlorampEY11 天前

能识别一个巴适就上天了。干脆以后让学生写作文都用非常土的土掉渣的方言土语

阿QQ 的头像
阿QQ10 天前

我已经准备付费Typeless了

实践哥 Li 的头像
实践哥 Li10 天前

为啥呢 豆包和微信表示为啥呢

阿QQ 的头像
阿QQ10 天前

大概每个人说话的习惯效果不一样吧,尤其是中英夹杂的话?属于花钱买时间了

ChlorampEY 的头像
ChlorampEY11 天前

你要么让这玩意去识别一下毛在1949年政权建立的说的那些话,你看看它是把毛说的那是不是会识别成中华人民共和鬼

SANWE 的头像
SANWE11 天前

为什么没测试funasr和电信的XingChenAGI

实践哥 Li 的头像
实践哥 Li11 天前

这两个好用么? 可以安排起来

Modengsir AI 的头像
Modengsir AI11 天前

效果巴适的很

实践哥 Li 的头像
实践哥 Li11 天前

👍 确实还可以以前要用 LLM 消化一下 whisper,现在不用了

Osaker 的头像
Osaker10 天前

中国明明有那么多新的中文优化的开源ASR模型,非得要找Whisper这个4年前的海外模型去比,还说是天花板,是否有点自欺欺人。

chang4tech 的头像
chang4tech11 天前

有能识别重音和语气的吗

二舅 的头像
二舅10 天前

马上去试试

阿台🕊️ 的头像
阿台🕊️11 天前

这 AI 咋跟个憨包一样。

李韭二 的头像
李韭二11 天前

最近ai短剧里方言特色的越来越多了

实践哥 Li 的头像
实践哥 Li11 天前

这个是我本地H3 出的,再用这个 hojo 去识别

我是透明人? 的头像
我是透明人?10 天前

语音识别不是豆包最强吗😂

ChlorampEY 的头像
ChlorampEY11 天前

一群神经病,非要把土话和普通话混杂,为何不把那yaodai也给造出个要逮的词,而不是用要得这个来代替?

Curline Zephirin 的头像
Curline Zephirin11 天前

大家默认OpenAI的Whisper中文是路边一条,谁默认他最强了

相关视频

万万没想到奥特曼昨夜放了大招,有一种王者归来的气势。原来我一直以为 OpenAI 的 Whisper 已经到了语音识别的天花板了。看来是我认知太浅薄了。 由于老婆就是川渝那边的,方言的味道绝对十足。如果走在街上,加上外界环境的嘈杂声,我之前用的 Whisper 测试过简直就是个瞎子,识别出来叽里呱啦的一大串乱七八糟的字符真的有点神奇。 这两天无意间看到了这个开源的模型,Hojo-ASR-Multi-V1,据说是语音识别领域的新星。 🔥 Hugging Face Open ASR Leaderboard 多语言榜全球第 7,开源多语言 ASR 第 1。 🎉五语种平均 WER 3.54%,模型权重开放、评测公开、结果可复现。 😄同时支持普通话、英语、粤语和四川话等多语言、多方言识别。 特意找来测试了一下,发现真的有意思。 更有意思的是 Hojo 的处理过程:声音 → Qwen3-Omni 音频编码器听懂声音 → Adapter 转换特征 → Qwen3-4B 生成文字。 通俗一点的讲就是:声音进来 → 音频编码器先“听懂”声音 → Adapter 把声音信息翻译成大模型能理解的格式 → Qwen3-4B 再把它变成文字。 而 Whisper:声音进来 → 转成频谱图 → Whisper 编码器提取声音信息 → Whisper 解码器直接生成文字 两者对比就是Whisper 的重点是 听声音 → 写文字,而 Hojo 则更偏向 听声音 → 理解声音 → 再根据理解生成文字。 所以最后我在本机做了一个测试结果还是非常不错的。 先解释一个百分比,CER = Character Error Rate,字符错误率,百分比越小越好。 然后可以看看我的视频 hojo 和 whisper的对比,做了三个例子,川渝话、广东话、普通话。 川渝话:hojo CER= 0%, whisper CER=42.9% 广东话:hojo CER=18.8%, whisper CER=43.8% 普通话:hojo CER=16.7%, whisper CER=25.0% 应该说 hojo这一套效果还是非常不错的。 最后附上他们的开源模型,有兴趣的可以本地部署玩玩看:

AI少年

93,688 次观看 • 10 天前

卧槽,我终于解决了英语学习的终极难题,任何基础的同学,按照我这个方法学习之后,百分之百可以告别哑巴英语! 方法论我就不展开介绍了,直接看视频,通俗易懂👇 说几点需要注意的事情: 1️⃣ 你肯定会说听不清,这是一种错觉,不存在听不清,你所谓的听不清,只是因为你脑子里在强行想文字,这段声音对应不上哪几个字,所以你才会把这种不适应总结为“听不清”。实际上哪有什么听不清,你只是不熟悉这段语音而已,你就把它当成鸟语,他怎么说你就模仿怎么说,重复几十遍,最后你发出的声音和这段声音一样,你再回头听最初的那句话瞬间就听懂了。难道“酱紫”你也听不清吗?“欧皓辰,我xuan你” 也听不清吗?那么大的声音都近距离进到你耳朵里了,怎么会听不清呢? 2️⃣ 有点书面英语水平的同学肯定会说:这不就是连读吗?错!这不是连读!如果你把他理解成连读,那就大错特错了!虽然连读的效果是一样的,但是底层思想和我要强调的思想完全不一样。所谓的连读底层思想还是先看字,然后通过文字去串起来模拟语音的效果,从根本上就搞错了。语言本来就是声音,你对这段声音采样,然后模仿这段声音,模仿几十遍和它做到一模一样,就 ok 了,下次再听到这段声音就会秒懂。 语言的本质是声音,人类漫长的历史长河中,语言很早就诞生了,而文字的诞生比语言本身晚了很多很多年,不要离开了文字就不能学语言了 不理解的同学可以回答一下这个灵魂拷问:文盲为什么会说话?

米开朗基杨

14,296 次观看 • 17 天前

先讲一个你可能从来没听说过的人。 1930年,英国语言学家 C.K. Ogden 做了一件很偏执的事——他把整个英语词汇表研究了一遍,然后问了一个问题:如果只能留下最核心的那些词,英语还能不能用? 他的答案是:850个词,够了。 这850个词,不是随便选的,是他穷尽分析之后筛选出来的"语言骨架"。他把它们分成5类: 100个操作词(Operations):这、那、是、有、做……就是那些让句子转起来的胶水词 400个普通事物(General Things):名词里最高频、最基础的那层 200个可描绘事物(Picturable Things):能画出来的具体东西,比如 door、fire、river 100个性质词(Qualities):描述世界的形容词,比如 clear、simple、important 50个反义词(Opposites):成对出现,学一个等于学两个 —————— 然后他把这套体系命名为 Basic English,发表出来。 接下来发生的事情更有意思。丘吉尔在二战期间公开赞扬这套体系,认为它是盟国推广英语教育的最佳基础。H.G. 威尔斯把它写进了《世界大战》的续集设定里,作为未来世界通用语言的蓝图。乔治·奥威尔……没有赞扬它,但《1984》里那套压缩语言"新话"(Newspeak)的灵感,正是来自对 Basic English 的深深警惕——他担心语言被缩减之后,人的思想也会跟着被缩减。 这就是这850个词的能量:支持者觉得它是桥梁,批评者觉得它是枷锁,争论了将近一百年。 但我想说的不是那场争论。我想说的是——这850个词,对今天的英语学习者来说意味着什么。 大多数人学英语,是被一本本厚厚的词汇书和无尽的考纲压着学的。CET-4、CET-6、托福、雅思……每一个证书背后都是几千个词的暴力记忆,背了忘,忘了背,从来没有真正"用"过。 Ogden 给出的逻辑完全相反:不是多,而是深。 这850个词,每一个都是高频中的高频,每一个在日常英语表达里都有不可替代的位置。当你真正把这850个词学透——不只知道它的意思,还知道它的用法、它的近义词在什么场景该用哪一个——你对英语的掌握会比背了5000个词却每个只认识中文意思要扎实得多。 这是一种截然不同的语言观:根扎得够深,枝才能生得够远。 —————— 于是我做了这个网站: (准确的说我让 Codex 做的) 原版 Ogden 的资料是一本PDF,黑白的,排版像上个世纪(它确实是上个世纪的)。我想让它变成真正可以用来学习的东西。 花了不少时间(花了不少 Token )最终做成了这样: 每一个词,都有一张完整的卡片。 卡片上有:这个词的中文释义、英文定义(用简单的英语解释英语,就像 Ogden 本人的风格)、一句真实语境下的例句,以及2到3个同义词。五个类别各有自己的颜色,一眼就知道你在学哪个区域的词汇。 每一个词,都可以听发音。 接的是有道词典的语音接口,默认英式发音,可以切换美式。点单词听一次,点例句听一次,语速比正常稍慢一点,适合跟读。不是那种机械的合成音,真的可以听。 最让我花心思的,是同义词那里。 很多人背单词的时候,同义词只是"差不多的意思"。但真正用英语的时候,difference 和 distinction 不一样,speak 和 talk 不一样,simple 和 easy 不一样。差在哪里?什么场景该用哪个? ——————— 网站是免费的,不需要注册,不会收集任何信息。 直接访问就行: 如果你身边有正在学英语的人,或者觉得自己英语"学了很多年但还是用不好"的,可以发给他们看看。 也许这850个词,是一个值得重新开始的起点。 👆 以上的文案也是它写的,我越来越没有用了

虎小象

976,491 次观看 • 3 个月前

NVIDIA 发布了类似豆包语音聊天的大模型 NVIDIA 放出了 PersonaPlex-7B-V1, 一个 7B 参数的全双工实时语音对话模型, 你可以理解为开源版的豆包语音聊天! 这玩意儿最牛的地方在于: 真正的全双工, 也就是说它能一边说一边听. 你打断它? 没问题, 它能立刻停下来听你说. 你俩同时说话? 也能处理. 这就是为啥叫 "Full Duplex" (全双工), 跟打电话一样自然. 技术上怎么实现的? 采用双流配置架构, 监听流和说话流同时运行. 模型基于 Moshi 架构魔改, 用 Mimi 编码器把语音压缩成神经编解码器 Token, 然后 7B 的 Transformer 同时预测文本和音频 Token, 最后 Mimi 解码器输出语音. 整个过程是流式的, 延迟极低. 还有个骚操作: 双重提示条件化. 你可以给它一段声音样本当 "声音提示", 它就能模仿那个声音风格说话; 再给个文本提示定义角色人设, 比如 "你是一个耐心的客服", 它就按这个人设来对话. 声音 + 人设, 都能定制. 跑分成绩: 在 FullDuplexBench 基准测试上, 平滑轮换成功率 90.8%, 用户打断处理成功率高达 95%, 响应延迟只有 170ms, 打断延迟 240ms. 官方说在对话动态、延迟、任务一致性上都优于其他开源和商业系统. 限制嘛: 目前只支持英语, 推荐硬件是 A100 80GB 或 H100, 不是一般人能跑得起的. 看了下训练数据用的是 Fisher English 数据集, 不到 1 万小时. 好消息是采用 NVIDIA Open Model License, 商用可用! 模型地址:

karminski-牙医

25,426 次观看 • 7 个月前

OpenAI 的大神 Andrej Karpathy 前几天在他的 YouTube 频道讲了一堂课,系统的介绍了大语言模型,内容深入浅出,非常赞,抽空将它翻译成了双语,由于内容较长,我将分批上传,以下是第一部分精校后的双语视频,字幕文稿如下: Intro: Large Language Model (LLM) talk 大家好。最近,我进行了一场关于大语言模型的 30 分钟入门讲座。遗憾的是,这次讲座没有被录制下来,但许多人在讲座后找到我,他们告诉我非常喜欢那次讲座。因此,我决定重新录制并上传到 YouTube,那么,让我们开始吧,为大家带来“忙碌人士的大语言模型入门”系列,主讲人 Scott。好的,那我们开始吧。 LLM Inference 首先,什么是大语言模型 (Large Language Model) 呢?其实,一个大语言模型就是由两个文件组成的。在这个假设的目录中会有两个文件。 以 Llama 2 70B 模型为例,这是一个由 Meta AI 发布的大语言模型。这是 Llama 系列语言模型的第二代,也是该系列中参数最多的模型,达到了 700 亿。LAMA2 系列包括了多个不同规模的模型,70 亿,130 亿,340 亿,700 亿是最大的一个。 现在很多人喜欢这个模型,因为它可能是目前公开权重最强大的模型。Meta 发布了这款模型的权重、架构和相关论文,所以任何人都可以很轻松地使用这个模型。这与其他一些你可能熟悉的语言模型不同,例如,如果你正在使用 ChatGPT 或类似的东西,其架构并未公开,是 OpenAI 的产权,你只能通过网页界面使用,但你实际上没有访问那个模型的权限。 在这种情况下,Llama 2 70B 模型实际上就是你电脑上的两个文件:一个是存储参数的文件,另一个是运行这些参数的代码。这些参数是神经网络(即语言模型)的权重或参数。我们稍后会详细解释。因为这是一个拥有 700 亿参数的模型,每个参数占用两个字节,因此参数文件的大小为 140 GB,之所以是两个字节,是因为这是 float 16 类型的数据。 除了这些参数,还有一大堆神经网络的参数。你还需要一些能运行神经网络的代码,这些代码被包含在我们所说的运行文件中。这个运行文件可以是 C 语言或 Python,或任何其他编程语言编写的。它可以用任何语言编写,但 C 语言是一种非常简单的语言,只是举个例子。只需大约 500 行 C 语言代码,无需任何其他依赖,就能构建起神经网络架构,并且主要依靠一些参数来运行模型。所以只需要这两个文件。 你只需带上这两个文件和你的 MacBook,就拥有了一个完整的工具包。你不需要连接互联网或其他任何设备。你可以拿着这两个文件,编译你的 C 语言代码。你将得到一个可针对参数运行并与语言模型交互的二进制文件。 比如,你可以让它写一首关于 Scale AI 公司的诗,语言模型就会开始生成文本。在这种情况下,它会按照指示为你创作一首关于 Scale AI 的诗。之所以选用 Scale AI 作为例子,你会在整个演讲中看到,是因为我最初在 Scale AI 举办的活动上介绍过这个话题,所以演讲中会多次提到它,以便内容更具体。这就是我们如何运行模型的方式。只需要两个文件和一台 MacBook。 我在这里稍微有点作弊,因为这并不是在运行一个有 700 亿参数的模型,而是在运行一个有 70 亿参数的模型。一个有 700 亿参数的模型运行速度大约会慢 10 倍。但我想给你们展示一下文本生成的过程,让你们了解它是什么样子。所以运行模型并不需要很多东西。这是一个非常小的程序包,但是当我们需要获取那些参数时,计算的复杂性就真正显现出来了。 那么,这些参数从何而来,我们如何获得它们?因为无论 run.c 文件中的内容是什么,神经网络的架构和前向传播都是算法上明确且公开的。

宝玉

1,124,245 次观看 • 2 年前