Loading video...

Video Failed to Load

Go Home

这两天关于 Jev 这个模型的热度非常之高,甚至可以说是近半年我重点关注了英推以来,看到的原创内容密度最高的一次。 正好我过去一年一直在跑一个小项目,其中有一个环节就是要对每天出版的《人民日报》上的新闻做一个分类,判断每一篇文章中是否包含有湖北相关的元素。 一年跑下来,积累了接近 2 万 4 千条数据,其中判定包含的有 1800 条左右。在这些数据的基础上,我随机筛选了一个测试数据集,其中包含了 500 条判定包含的内容,以及 500 条判定不包含的内容。 之前我使用的模型一直是 Gemini 的 Flash Lite 系列,也算是经过测试后成本和速度双重考虑下的最佳选择。 今天 OpenRouter 上线了这个 Jev 之后,我用同样的提示词做了一个小 Demo 做了一下对比测试,下面这个视频就是同时并发 16 个进程的实录效果。 不得不说,测试出来的结果超出预期很让人惊喜啊。 首先,速度是真快!相对于 Gemini Flash Lite 单篇文章 3 秒的平均耗时,Jev 把单篇耗时缩减到了 0.35 秒。这个接近 10 倍的速度提升,真的是实现了质的飞跃,带了很多新场景的想象空间。 其次,质量也真不错!和 Gemini Flash Lite 的分类结果相比对,Jev 大概在...

18,658 views • 20 days ago •via X (Twitter)

31 Comments

Mr.K's profile picture
Mr.K19 days ago

不是,这种任务典型的能力错配,让 Gemini 几分钟给你写一个朴素贝叶斯模型,处理一千篇文章的分类都根本用不上一秒,准确和召回都能高得多

李不凯正在研究's profile picture
李不凯正在研究19 days ago

的确是想过这么干,但判断是否涉及湖北的因子是否太多了?等我晚点让 AI 写个对比一下看看

李不凯正在研究's profile picture
李不凯正在研究19 days ago

感觉贝叶斯方法在这种需要穷尽关键词的应用场景中效果没有那么好

Wei佳's profile picture
Wei佳19 days ago

这速度看着很爽啊

李不凯正在研究's profile picture
李不凯正在研究19 days ago

非常爽,赏心悦目

霹雳游侠's profile picture
霹雳游侠20 days ago

你用Gemini境外模型做湖北政府的项目,这个不是数据出境了吗? 你们也是接的外包项目么,之前Claude的类似案例估计就是这种😁

李不凯正在研究's profile picture
李不凯正在研究20 days ago

首先,不是政府项目,是我个人的小项目,其次,用的是人民日报的公开信息,不涉及任何秘密和隐私,最后,国模型真干不了这活,浑身敏感词啊

霹雳游侠's profile picture
霹雳游侠19 days ago

嗯,那就好,别到时干个外包活,上面查下来,你被撸了。 我听你说在人民日报找涉及湖北的信息,以为是湖北政府的外包项目。

王柯基's profile picture
王柯基19 days ago

@libukai 然后过几天google又发布了个AI人权报告,说我们利用美国豆包做政府项目外包哈哈哈

李不凯正在研究's profile picture
李不凯正在研究19 days ago

@BarrettDream 哈哈哈,能有免费广告也行啊

山麻楂菜角子's profile picture
山麻楂菜角子19 days ago

挺有意思,15% 的偏差是可接受的 还是可以人来兜底?

李不凯正在研究's profile picture
李不凯正在研究19 days ago

算是可以接受吧,后面还有 AI 的二次判断

BYBYBYBY's profile picture
BYBYBYBY19 days ago

一年两万条做湖北相关分类,小判别模型其实挺合适。大模型那边你有没有对过召回和误报,单条成本大概差几倍?

Voyager | 舟行's profile picture
Voyager | 舟行19 days ago

感觉适合信息初筛

李不凯正在研究's profile picture
李不凯正在研究19 days ago

对,重点在于“初”这个词

帀安交易所注册 买美股上帀安's profile picture
帀安交易所注册 买美股上帀安19 days ago

两万条湖北相关的样本,这数据量够训个小分类器了吧

风雪漫千山's profile picture
风雪漫千山19 days ago

高密度原创才是核心,好项目码住!

along's profile picture
along19 days ago

我想了解一下,就是那 15% 的不一致的情况,有没有可能优化prompt 来去提升准确率

李不凯正在研究's profile picture
李不凯正在研究19 days ago

有优化空间的,这个 Prompt 我改过很多遍,原则上是尽可能放宽了标准的,因为后面还有一道 AI 和一道人工,只需要做初筛就行了

Berryxia.AI's profile picture
Berryxia.AI19 days ago

这个不错…

李不凯正在研究's profile picture
李不凯正在研究19 days ago

对中文内容判断能做到这个程度也真是超出预期了

Dalin Huang's profile picture
Dalin Huang19 days ago

85% F1 比较勉强,微调一下qwen 4B模型,跑到95%以上没啥问题🤔 训练成本几百美金

李不凯正在研究's profile picture
李不凯正在研究19 days ago

这个实际正确率应该在 95% 了,15%只是差异率。至于训练模型,我真不会啊……

Dalin Huang's profile picture
Dalin Huang19 days ago

我也不会,claude都会🤣

李不凯正在研究's profile picture
李不凯正在研究19 days ago

听劝去对比测试贝叶斯分类器去了,还是有自己的测试集爽啊,想干啥干啥

Roland出海搞钱(大胡子版)'s profile picture
Roland出海搞钱(大胡子版)19 days ago

这个比较适合做舆情监测项目吧?

李不凯正在研究's profile picture
李不凯正在研究19 days ago

感觉挺适合的,量越大实时性要求越高越适合,例如实时的弹幕审核

凯文在地球's profile picture
凯文在地球19 days ago

jev刚上线就这么多人在关注,有那么厉害吗?我梳理了一下,确实还挺好玩的。

CraftSail's profile picture
CraftSail20 days ago

这个能炒股吗😃

李不凯正在研究's profile picture
李不凯正在研究20 days ago

这么快的速度,应该很快就能爆仓吧

eLongZ's profile picture
eLongZ19 days ago

写得很详细,受教。我也去注册个,很多场景都 用到。

Related Videos

“我们究竟是创造了一个工具还是一个生物?” Sam 在 "机器人之心 "小组讨论会上的发言。 Sam: 但我认为,这无疑是迄今为止人类经历的最重大的更新年份。可能这也是我们将会遭遇的最大变革,因为从现在开始,人们已经接受强大的人工智能将成为现实,并且还会有逐步的更新。就像是第一代 iPhone 面世的那年,以及随后每一代 iPhone 的更新,我们现在能够明显感受到这一代与去年那代的差异。所以,这确实是一个重要的时刻。 我感到欣慰的是,现在人们开始正确地把这些系统当作工具来看待。艺术家尤其如此,但其他人也是一样。 曾经,人们真正恐惧的是,我们究竟是创造了一个工具还是一个生物,这将意味着什么?现在,人们视这些系统为人类工具箱中的新工具,并且正在用它创造一些非常了不起的东西。 模型显然不知道你在说什么,因为这不在它的训练数据里,它也无法从训练数据中学习到这些信息。 这是完全可以预期的。你再问一遍。比如说,你提到“意识”这个概念,模型回答:“是的,我完全明白你的意思,但我之前从未听说过这个词。” 问: “这对我来说就像是一次更新。你认为人工智能会趋向于探索创造性智能和自主性吗?” Sam: 这个问题有多个答案。这取决于激励模型。这是人类的选择。 问: “这将是判断意识的一个很好的测试。因为如果它有自我表达的愿望,并且仅仅为了创作的乐趣而去创作,那不会是偶然的。这绝对有点像生物。” Sam: 这是生物化的。我认为在此之前还有很多步骤。 我们现在要回答问题吗?这真的很棒。

Lei.sea

14,132 views • 2 years ago

最牛叉的 polymarket 自动交易机器人!! 我个人在用,已实现不错盈利和交易量!! [15分钟、5分钟加密货币涨跌交易] >>> (自动跳转TG) 首先,我个人不反对使用 polymarket 跟单交易机器人,但是也不支持。 原因,前两天我在老外区找到了一个使用人数接近2w人的跟单交易机器人。 看到很多老外在推特上晒出的聪明钱包,我也想着跟单一手,然后高高兴兴的去睡觉了。 结果醒来一看,曹尼玛,200美金直接飞了,麻痹,感情全给这些所谓的聪明钱包抬轿子了。 那时候我就想,既然跟单是行不通了,那么机器人直接自动交易呢? 这不,我发现了这款 polymarket 自动交易机器人。 用到现在,不到三天,但是我真的很想给它点个赞,给创始人点个赞。 >>> 其实使用起来,我也是走了不少歪路的。 使用的第一天,没有把止损设置好(那个按钮默认显示✅️,我以为就是设置好了的,但其实需要设置为❌️,才能真正的止损),这也导致了我才使用不到5小时,50美金直接全部亏光光,麻痹。(其实亏光光的原因还有一点,我没有设置好参数) 然后第二天我就暂停使用了,因为我以为是机器人本身的问题。好在我在群里发现了其他一些人的比较好的参数,并且同时!!!发现了我的止损没有设置好。 接着第二天这个时候我把参数设置好、止损设置好后,没有着急跑实盘交易,而是先用模拟盘跑了大约12个小时。 第三天看了一下模拟盘战绩,感觉5分钟的不太好,于是启动了15分钟的交易(今天凌晨1.30分左右),初始放了30美金进去,现在来到了80美金,收获了盈利,也收获了接近4000美金的交易量。 >>> 这个号单次下单金额为5美金,同时还做了另外一个号,单次下单金额为10美金(其它参数一样),两个号都有的赚,10美金那个号当然交易量会更多。 虽然说现在感觉还不错(实现了盈利+交易量),但是我也不知道后面的情况到底会如何,毕竟市场和交易是谁也没法预判的…… 不过有想体验一下的,可以从上面进,就是一个TG交易机器人,建议设置好参数后(可以先模拟盘交易,也可以问我要参数),也是从少量成本做起,毕竟心急吃不了热豆腐的。 [Do Your Own Research]

金麦飞JMF🦞

52,219 views • 7 months ago

卧槽??一个不到 2B、能本地部署的小模型,给真实 Issue 做分类,跟 JEV 的结果居然这么接近? 最近 JEV 的玩法看了不少,给邮件分类、给 Agent 选工具。这类需求太常见了,我就想知道这张工单该分给谁、下一步该调用哪个工具,真不用每次都给我写一篇分析。 所以这次我把 JEV 和 This That 都接进 Pi,直接拉了 OpenAI Codex 仓库的 30 条真实 Issue,让它们现场做题。 用户是在报 Bug、提功能需求,还是问怎么用?问题出在登录、界面、执行还是会话? 同一份内容、同一组选项,每条做两项判断,两边各发 60 次请求。 跑完一看:JEV 用了 23.5 秒,This That 用了 25.6 秒。30 条里,28 条的两项判断完全一样,两边都没出现请求失败。 速度这轮还是 JEV 快一点。但 This That 只有 18.8 亿参数,权重约 3.76GB,而且能下载到自己机器上跑。这个结果真让我想继续折腾一下了。 它的用法也很干脆:把问题和选项给进去,一次计算直接返回选择和概率。程序拿到结果就能接着往下走,不用再从一大段回答里抠出一个“是”或者“否”。 更实用的是本地部署。客户工单、内部文档、还没发布的产品资料,这些东西只是想分个类,也不一定愿意全部发到外面的 API。 This That 支持 NVIDIA GPU、Apple Silicon 和 CPU,可以把这一步判断留在自己的设备上。做 Agent 的人,手里又多了一个能自己控制的小工具。 这次我跑的是 API 对比,本地性能还没测。28/30 是两个模型判断一致,也不等于准确率,这两个口径先说清楚。 完整录屏放上面。做客服分流、邮件分类、Agent 工具选择的,直接拿一批自己业务里的真实数据试试,比盯着榜单猜有用。 模型和权重: 免费体验地址:

Yanhua

25,209 views • 15 days ago

🤯电影都拍不出的桥段👺 庭审前究竟发生了什么⁉️⁉️⁉️ 文贵世纪大案量刑庭审: 庭审前吐血、昏倒、现 #神秘黑衣女子 ! 庭上还继续磕血!🥺 #文贵先生 指检察官 #撒谎: 你不用相信我的话,请调看今天的监控!🤯 全世界都在等待真相‼️‼️‼️ 正文: 一直到3:55左右呢,他们才出来,也就将近一个小时,他们在房间里不知道在说什么。然后出来之后呢,很快就在这个安排下呢,我们就开始了这个啊,开始开庭。 然后这个时候呢,文贵先生才啊,最后一个从这个庭审的地方、从门口出来。然后啊,看到文贵先生的第一眼,我是觉得文贵先生有些苍白,脸庞非常的苍白,但是也不知道为什么。 后来呢,我们终于在啊最后,就是整个快结束的时候,文贵先生呢,最后啊,当这个法官问到文贵先生说:“被告,你有没有什么话要陈述?”那这个时候,文贵先生呢就站了起来,然后他才把今天为什么我们的庭审会往后拖的这个时间呢,通过翻译传递给了这个法院法官,也传递给了法庭。 也是这个时候,我们才了解到,为什么我们今天会等待这么长的时间。 那在这个很简短的文贵先生的这个发言里面,他啊就讲到,他自己原本没有打算要发言,但是因为今天发生的种种的原因,所以他决定要在这个时候站起来说几句话。 那他的话里面就讲到了啊,就是说,他今天早上5点钟起来的时候呢,他有昏过去。昏过去了之后呢,起来就啊开始呃有血,吐血。然后呢,他的血呢,把他的脸,还有他的衣服上都啊都都弄到了血。然后这个MDC呢就叫了——对,一条胳膊上都是血——然后MDC呢就叫了这个911,也就是急救车。 然后急救车呢,就把他送到了这个医院。医院的这个啊医生呢,啊,认为他需要打针,给他打了两针。我不知道打的具体什么针,但是给了他注射了两针,告诉他:“你需要stay,你需要在医院里面休息。” 但是文贵先生是说:“我要去,我要去法庭,我要去法庭。” 但是呢,后来他们把文贵先生带回了MDC,让他先在那边啊等候医生。后来呢,的确有医生来看了他,但是在MDC的医生。但是医生呢又走了。 过了一会呢,又有一位啊,不知道呃是什么、是不知道身份的女生啊。他说是文贵先生描述,是一位神秘的女士,然后在穿黑衣服,穿着黑色的衣服,在1点半的时候进来,说:“我要带你去法院。” 然后这个时候就啊,他们在走的时候呢,在他上车之前呢,把他的衣服剪换掉了,剪开了,然后用布让他擦干净脸上的血,然后换上了他在我们法庭上看到的一件黄色的、米色的这个呃这个囚犯的这个衣服。也就是他刚才在庭审上,我们大家都看到的这件衣服,她才出来带走了他。 但是这位女士很神秘。为什么呢?她没有跟七哥的法警一起坐在这个车上。一般的话,从MDC出发的会有两名法警。那今天很奇葩啊,这位神秘的女士坐上了一辆——嗯,七哥描述是BMW,坐了另外一辆车,也就是宝马车——然后跟他一起来到法院的。 这个只有车上只有一位法警。所以这个事实呢,也被在今天的庭审的时候,检方描述的时候所歪曲。所以说七哥在他的讲话里面有澄清。 那我具体的内容,我们几位啊,可以补充我们细节的话。大概今天为什么晚到这么长时间,让所有的战友啊,就在等候这个结果的原因,就是这样的一个原因。 那刚才我们收到啊,七哥的律师说,呃,七哥现在没有事儿,他应该快到MDC了啊,应该快回到MDC了。所以说我们也啊,看看待会七哥有没有办法给我们打电话。 嗯,刚才那个我补充一下。Ava其实说到一个很关键的,就是这个庭审和之前完全就不一样。首先她没有让我们上去,第二,她没有——她就是很多情况下的这种没有告知的延期,从这个1点到3点半,到3点,然后又到4点,是吧?这样的延期。 事实上这个,后来我们是通过文贵先生,他真的是口述,所有大家才知道,就是那一刻之前,早上到那一刻发生了什么。 那正常这种情况来说,用文贵先生他描述的说:“我晕过去了,然后吐血,而且医院已经给出了这个回应,说你需要留在这里。”在这种情况下,一般情况这个sentence应该不进行,他应该住院,今天的开庭应该是被延期的。也就是说,正常来说,今天不应该再继续开庭了。 对,但是文贵先生在庭上讲,他在10点半的时候,就是接到了MDC这个狱警电话。MDC接到那个狱警接到MDC电话,说要把他带回去。然后带回去之后又要这个看医生。看医生之后,然后说,唉,我还是要治疗的。结果下午1点半的时候,又有了这个神秘女士的出现,带着mask说:“我现在带你去上庭。” 而且这个过程中,事实上,刚才Ava还讲了一个很关键一点,就是其实我们知道,前几天七哥打电话,他说过,说:“我这个不想说什么话。”但是他今天,其实说,本来他说:“我就说两句话,是吧?”但是他今天是临时——大家在那个看,在这个15D和这个视频上,大家都能看到,七哥站起来时候,说话的声音是哑的。 对,他完全在那一刻之前,甚至就是在这个开庭的时候,可能他还没有想过说要说这个话。他完全是没有准备,完全是这个自己就说今天的当时经历。 但是我相信,就是这个当时的这个检察官他说的这个话,触动了七哥,也触动了我们。 因为在前面大家知道,整个的这个sentence它是有一个过程的。它有这个呃,检察官要发言,辩方律师要发言,所谓受害者陈述要发言,然后法官要去这个梳理整个的一个她量刑的标准PSR,然后最后给出一个量刑标准。这是一个大概的一个程序。 那么七哥的他的权利是可以说话,你也可以不说话。很多有的时候,就是有些犯人,他为什么选择不说话呢?因为他这个觉得“我说的话可能会影响我的上诉”,所以他就选择不说话,这些都是可以的。 但是今天,七哥今天在这个,也就是这个辩方他在发言的时候,他就说了一句,说这个呃:“郭文贵是个骗子,这个骗子他到今天都不思悔改,以至于他到现在还在装病,来故意地拖延这个庭审。所以说法官大人,我建议你重判他,因为他到现在还不思悔改。” 所以这个细节,我相信是触动了这个文贵先生。然后文贵先生站起来,他就讲说这个——他说的刚才说到这些细节的时候,他说:“你都不需要相信我,这些这个MDC医院,还有我们在这个SDNY,就是这个南区法院,都有摄像头,都有监控。你都可以去问这些警察,我说的是不是事实,是吧?” 然后这个,包括刚才那个Ava讲到,就是呃,事实上他那个被带到SDNY的时候,带到这个南区法院的时候,他还想用洗手间。他还说:“我不行,我肚子痛,我还想吐血。”然后这个呃,就不让他用,然后又给他放到另外一个房间。而且当时就说,这个神秘女士一直都在啊。 然后这个呃,同时呢,七哥也说了,说他为什么今天我要说出这些。因为现在检方,你今天就是个很好的例子。他说的没有一件事是真的。说一个法警跟着,其实是两个法警,对,说是一个,然后事实上是有两个人。 那么他同时他又说:“你作为检察官,到今天为止,你又当法官,你又当警察,你又当医生,你什么——你说什么就是什么。” 对,然后呢,那这个我法官大人,我今天想说的,我和我的律师,在822文件里面都已经阐述了。我相信美国的法律啊。但是就说,我过去因为我这个灭共的事业,我全家有270个人被抓,我失去了几十亿的上百亿的资产啊。然后我失去这些钱,但是我谢谢咱们法庭和法官所做的一切的努力。然后最后一句话,说:“我要上诉,我要上诉。” 对,其实七哥今天脸,确实脸色进来的时候是白,加上有一点黄,其实。嗯,但是呢,七哥就是我觉得也是看到战友了,他在强打起来精神,一直在和战友们去对视啊。包括有咱们战友里面有小朋友,然后七哥也是一直在做合十的手势,一直在和大家点头微笑。 嗯,很多战友们也都是在这个呃,给他回手势,对,给他回手势,嗯。 然后我觉得,嗯,其实刚刚除了——七哥其实在庭上也有咳血,然后嗯,就是拿那个白色的卫生纸,他不是整吐血,是拿这个卫生纸一擦,这就是都是血。然后七哥把这个纸也对着检察官这样晃了晃。 这是在七哥去讲完了这么多话的时候,之后去呃做的一个动作。然后呃,其他的法警就把垃圾桶拿过来。七哥我看到擦了好几张,因为有法警挡住了,我觉得四五次。嗯,对,嗯,也对,就是我们都是看到了的,这些都是我们是都是看到了的。 嗯,然后我觉得今天其实战友们,我觉得表现的应该可以让七哥很放心,因为战友们非常的冷静,非常的淡定。

喜马拉雅日本勇者村

31,545 views • 3 months ago

如何让小型语言模型高效工作。Yejin Choi在2024年数据与AI峰会上发表演讲(双语字幕) 演讲者:Yejin Choi,华盛顿大学教授、麦克阿瑟奖学金获得者,同时也是AI2常识AI的高级研究主任 这个演讲是将如何优化小模型的,他们训练了一个 0.5B 参数的小模型做文档摘要任务,超过了GPT-3.5。 按照演讲者的结论:AI 的性能,至少在目前的形态下,取决于它的训练数据。因此,过去和现在的 AI 主要依赖于人类生成的数据,但未来可能会依赖于 AI 生成的数据。很多可能担心合成数据质量不高,可能存在偏见,但是,越来越多的证据表明,这种方法是有效的。 例如,使用 Meta 的 SAM(Segment Anything)进行图像分割就是 AI 合成图像分割注释的一个例子。虽然有人类的验证帮助,但是单靠人类无法对如此多的图像样本进行注释。这是另一个例子。Microsoft 的论文"Textbooks are all you need"是另一个例证。当你有真正高质量的数据,例如教科书级别的数据,经过合成,你实际上可以在许多、许多不同的任务中与规模更大的对手竞争。可能在某些方面,它并不像大型模型那样具有广泛的适用性,但这对于满足许多商业需求来说是非常出色的。你可能不需要通才,你可能需要专家。 此外,"Textbooks are all you need"论文的观点也证明了,数据质量是最重要的。这并不仅仅关乎数量,更在于质量。DALL-3 就是一个很好的例子。为什么它会突然之间超越了 DALL-E 2 呢?很大程度上是因为它有更好的图像标注。但是,究竟是哪些更好的图像标注呢?在此之前,我们使用了所有好的图像标注。他们将这些图像标注进行了合成。这就是我们获得高质量数据的方式。 所以,AI 的质量更关乎数据的质量、新颖性和多样性,而不仅仅是数量。 * 引言 好的。我来这里要跟你们分享一些看似不可能实现的可能性。 * 介绍 去年,当有人问 Sam Altman 如何让印度的创业公司为印度创建基础模型时,他的回答是,不用费那个劲了。这根本没希望。 哇。首先,我希望印度的创业公司不会轻易放弃。其次,这种对话可能会在任何地方发生。无论是在美国的任何一所大学,或是创业公司,或是研究机构,他们都可能面临没有足够计算能力的问题。 所以,这就引出了我们要讨论的问题:不可能的提炼。如何以环保的方式训练出你的小型语言模型,使其效果堪比真实模型。 * 当前的方法与挑战 目前我们听到的最佳做法是大规模的预训练,紧接着进行大规模的后训练,例如 RLHF。如果我告诉你我打算从 GPT-2 开始,那个不被大众关注的小型、低质量模型,我也不知道为什么,但以某种方式,我们将创造或提炼出一个高质量的小型模型,然后与可能大两个数量级的更强大的模型竞争。这听起来应该很不可能,尤其是当你可能听说过一篇论文,标题是《模仿大型语言模型的虚假希望》。 虽然他们所报告的对于他们进行的特定评估实验来说是真实的,但请不要过分泛化,认为所有的小型语言模型都无法媲美大型模型。因为还有许多其他反例证明特定于任务的符号知识精馏可以奏效在许多不同的任务和领域中其中一些来自我的实验室。 然而今天,我只想关注一个任务即如何学习语言中的抽象。为了简化这个任务,我们从句子摘要开始这是我们的第一个不可能的任务。 * 任务一:句子摘要 目标是在没有极端规模的预训练、没有大规模的 RLHF、以及没有大规模的有监督数据集的情况下实现这一目标。这些东西并不总是必要的。但等一下,我们必须使用通常是所有三个,至少是其中一部分。 但如果没有这些,我们如何能和更大的模型一较高下呢?关键的直觉是当前的 AI 能做得多好取决于它所接受的训练数据。我们必须有某种优势。我们不能没有任何优势,所以那个优势将来自数据。顺便说一下,我们必须合成数据,因为如果数据已经存在于互联网上某处 OpenAI 已经对其进行了爬取,那就不是你的优势了,他们也有,所以你必须创造出一些真正新颖的东西,比现有的东西更好。 通常,精馏是从大型模型开始的,但我们将丢弃它,以向你展示我们可能对隐藏的可能性视而不见。所以我现在就开始示范。从 GPT-2 开始,那个质量很差的模型。然后我将进行一些创新,我马上就会概述,制作出高质量的数据集,然后可以用来训练小模型,这个模型将成为执行特定任务的强大模型。 但问题是,GPT-2 甚至无法理解你的提示词。你无法利用 GPT-2 进行提示词工程。你让它总结你的句子,它生成的一些输出,完全没有任何意义。所以你再试一次,因为它的输出通常有随机性。你可以生成很多不同的例子,比如几百个例子,我们发现它的表现几乎总是不好,像好的不到 0.1%。 * 解决方法与进展 但是有志者事竟成。所以我们想出了许多不同的办法。这其中包括我们的神经解码。这是一种即时推理算法,可以将任何逻辑约束加入到你的语言模型输出中。对于任何现成的模型,我们都可以使用这个来引导输出的语义空间。 但是因为 GPT-2 太糟糕了,即使使用了这个,成功率也只有 1%。但这比零要好。现在我们已经有了进展。因为如果你生成大量的样本,然后进行筛选,你实际上可以这样得到一些好的例子。然后,聪明的学生们提出了许多不同的想法。 我就不详述技术细节了,但我们找到了一些方法。为了能更容易找到好的例子,我们需要将成功的概率提高到 10% 以上。总体的流程是这样的:首先,从一个质量较差的教师模型开始,生成大量的数据点。然后,由于数据中存在大量的噪声,需要进行严格的过滤。 我们使用了一个三层过滤系统。虽然细节并不重要,但我要强调其中的第一个,即 Intel Monte 过滤器,它基于现成的 Intel Monte 分类器,能判断一个摘要是否能从原文中逻辑推断出来。这个模型并不完美,可能只有 70% 到 80% 的准确度。但是,当你大力使用它来过滤数据时,它的表现已经足够好了。 然后,我们使用这些数据来训练一个更小的模型,这个模型可以成为下一代学生的教师模型。我们重复了这个过程几次,最终得到了高质量的 DIMM sum 数据和高质量的模型。 在与那时最好的模型 GPT-3 进行对比时,那时,GPT-3 是最好的摘要模型。但当 ChatGPT 问世后,我们成功地超过了 GPT-3,人们似乎不再关心其他的,因为 ChatGPT 能做任何事情,包括摘要,所以我们为什么还要费心呢? * 任务二:文档摘要 接下来是我们的“不可能完成的任务 2”。我们现在将与 ChatGPT 3.5 展开竞争。并且,要让我们的挑战更具难度——我们现在要总结的是整个文档,而不仅仅是句子。然后,我们还要做到以上所有这些而不依赖于那个现成的蕴含分类器。 我的意思是,实际上你可以这么做,就像从学术角度来看,我们想看看我们能在多大程度上打破关于规模的普遍假设。因此,我们在 InfoSumm 的新工作是一种基于信息理论的蒸馏方法其中关键的想法是我们将不再使用那个现成的 Imitating Humans LLM。我们将使用一些公式,这个公式其实只有三行,包括一些你可以用现成的语言模型来计算的条件概率得分。 * 实验与成果 现在时间还早,所以我们不深入讨论这些公式的细节。但我可以大体上告诉你,如果你把这些公式重新排列一下,你可以将此理解为点对点互信息的特例。你可以用它来过滤你的数据。因此,我们使用的是和之前相同的整体框架。我们现在使用 PTHEA 2.8 亿参数模型,因为我们觉得它比 GPT-2 稍好一些。 至于过滤,我们现在使用的是我之前向你们展示过的那三个简短的公式。然后我们就做同样的事情。这一次,我们让模型变得更小,只有 5 亿参数模型。这带来了高质量的文档摘要数据集,以及模型。 那么我们的表现如何呢?正如我们所承诺的,至少在这个任务上,我们的表现能与 ChatGPT-3.5 媲美,或者,根据评测的设定和标准,我们的表现甚至有所超越。你可以在我们的论文中找到更多的细节。 * 任务三:学习抽象思考 总的来说,我展示了我们如何学习文档摘要,即使不依赖于大规模预训练模型和其他大规模资源。然而,这两篇论文背后的真正研究问题是,我们如何学习进行抽象思考。 因为现在的做法就是让模型尽可能地大。越大越好。但是我们人类,无法像模型那样记住所有的上下文,比如一百万个 Token。没有人能记住上下文中的一百万个 Token。你会立刻抽象出我刚才告诉你的所有事情。但是你仍然记得我到目前为止说的所有话。这就是人类的惊人智能,我们还不知道如何通过 AI 模型有效地实现这一点。我相信这是可能的。我们只是还没有尽力去探索,因为我们被大规模的迷惑了。 * 任务四:Infini-gram 好的。那么,Infini-gram 就是我们面临的第三个挑战。稍微转换一下话题,现在的任务是让经典的统计 N-gram 语言模型在神经语言模型中发挥一定的作用。你们中有多少人还在讨论 n-gram 模型呢?我也不清楚。你们现在还在学习这个吗? 这里我们设定 n 等于无穷大。我们将在数万亿的 token 上完成这个计算,反应时间必须非常快,而且我们甚至不需要使用一颗 GPU。哇!我来告诉你们这有多么困难。假设,如果你要在一个经典的 n-gram 语言模型中索引 5 万亿个 token,且 n 无限大,那么你大概需要处理 2 千万亿个唯一的 n-gram 序列。你需要枚举,排序,计数,存储一些错误,这可能需要占用大约 32 太字节的硬盘空间,甚至更多。我们又怎么知道 呢?但这个数据量实在太大了。我们无法处理。 如果你看看其他人建立的大规模经典 N-gram 模型,那就是 Google。在 2007 年,由 Jeff Dean 和其他人带领的团队,他们只处理了 2 万亿个 token——我的意思是,对于那个时代来说,这已经是很大的数量了。他们使用的是五元 n-gram,这就产生了大约 3000 亿个不同的 n-gram 序列,这些序列他们都需要进行枚举、排序、计数等操作。这个数量实在是太庞大了。大家其实并没有进一步增加这个数量。那么,我们到底是如何做到将这个数量无限扩大的呢? 在我解释我们如何做到这一点之前,如果你感兴趣的话,我邀请你去查看这个在线演示。 token。这里有一个例子,它是一个 48 个字符的词。我不明白为什么这个词会存在。但是如果你去搜索它,你会发现它不仅存在,而且还有超过 3000 个实例。这个搜索过程耗时 5.5 毫秒。此外,它还会向你展示如何对这个长词进行分词。你也可以试试搜索多个词,看看下一个可能出现的词是什么。比如,"行动胜过语言",那么接下来可能是什么词呢?该网站会向你展示可能出现的下一个词。而且,这个过程非常快速。 * 解决方法与进展 那么,我们是如何做到这一切的呢?你可能会惊讶地发现,我们的方法其实非常简单。有一种叫做后缀数组的数据结构,可能并不是所有的算法课程都会教授,但是有一些课程会教授。这是一种我们非常小心地实施的数据结构。所以我们用后缀数组索引整个网络语料库。事实上,我们并没有预先计算这些 n-gram 的统计数据。我们只是预先准备好这个数据结构。当你进行特定的查询时,我们会实时计算。多亏了这个数据结构——我们可以做得非常快,尤其是在使用 C++ 实现的情况下。我知道现在 AI 研究中,C++ 可能不是大家首选的语言,但实际上,使用 C++ 会让程序运行得更快。 这样做的成本有多低呢?其实我们只花了几百美元就索引了全部内容,而且,为 API 服务的成本也相当低。即便没有 GPU,它的速度也非常快。不同类型的 API 调用的延迟只有几十毫秒。你可以利用这个做很多事情。我现在可以分享的一点是,你可以用我们的 Infinigram 插值你的神经语言模型,降低困惑度,这是常用于评估语言模型质量的指标。我认为这只是我们能做的事情的冰山一角。实际上,我还在研究一些我希望能分享,但现在还不能告诉你们的东西。 不过我们已经开始提供这些 API 端点。从几周前开始计数,到现在我们已经提供了 6000 万次 API 调用,这还不包括我们自己的使用。我非常想知道人们是如何使用我们的 InfiniGram 的。 * 总结 总结一下,我的演讲主要是说,AI 的性能,至少在目前的形态下,取决于它的训练数据。因此,过去和现在的 AI 主要依赖于人类生成的数据,但未来可能会依赖于 AI 生成的数据。我知道人们对此有很多担忧,可能担心质量不高,可能存在偏见。因此,你不能以普通的方式来进行这项工作。你应该以更有创新性的方式来进行。但是,越来越多的证据表明,这种方法是有效的。 例如,使用 Meta 的 SAM(Segment Anything)进行图像分割就是 AI 合成图像分割注释的一个例子。虽然有人类的验证帮助,但是单靠人类无法对如此多的图像样本进行注释。这是另一个例子。Microsoft 的论文"Textbooks are all you need"是另一个例证。当你有真正高质量的数据,例如教科书级别的数据,经过合成,你实际上可以在许多、许多不同的任务中与规模更大的对手竞争。可能在某些方面,它并不像大型模型那样具有广泛的适用性,但这对于满足许多商业需求来说是非常出色的。你可能不需要通才,你可能需要专家。 此外,"Textbooks are all you need"也意味着,质量是最重要的。这并不仅仅关乎数量,更在于质量。DALL-3 就是一个很好的例子。为什么它会突然之间超越了 DALL-E 2 呢?很大程度上是因为它有更好的图像标注。但是,究竟是哪些更好的图像标注呢?在此之前,我们使用了所有好的图像标注。他们将这些图像标注进行了合成。这就是我们获得高质量数据的方式。当然,你需要小心翼翼地进行,但是有越来越多的任务特定符号知识蒸馏的例子,包括我自己实验室的工作,都证明了这是可行的。这真的可以让小模型发挥出惊人的潜力。 所以,这更关乎数据的质量、新颖性和多样性,而不仅仅是数量。 我就在这里结束我的演讲。谢谢。 视频来源:

宝玉

59,826 views • 2 years ago

给大家带来小米 MiMo-v2.6-pro 的测试速报! 简单来讲, 这次不愧是直播RL带来的效果, AgenticCoding 能力提升明显, 之前的 MiMo-v2.5-Pro 在我的向量数据库测试中得分只有2505, 而这次直接翻了3倍, 得分来到了7810. 与 Claude Fable-5 分数接近了. 而且算法也进化为了单图HNSW分层近邻图(M=16/M0=28) + AVX-512精确距离 + 每线程visited stamp. 可以说只要再优化一下算法细节就是SOTA水平了. 而前端测试则是MiMo需要提升的重点了, 这次演示效果虽然有提升, 但是无奈横评的其他模型都太强大了, 而小米的加分项也是本身的算法Coding能力, 比如它是可以 one-shot 写出一个光追引擎的. 但是由于空间理解/物理模拟能力不到位, 小球没办法完成把墙壁撞破的演示. 另外本次还给大家测试了输出速度, MiMo-v2.6-pro-ultraspeed 版本可以达到464tps的速度, 着实恐怖. 而根据MiMo的技术报告, 峰值可以达到900tps, 常态化请求也可以稳定在500tps左右, 考虑到模型 1.02T 的总参数量, 以及高达 42B 的激活参数量, 再加上同等规模模型一般都在60-80tps的水平, 这个成绩相当亮眼. 当然也有值得注意的点, 比如这次测试我发现它还是有早停的问题的, 上面的向量数据库测试, 每轮最大迭代50次, 但是三次测试中, 有两次它迭代到30轮左右就没办法提升分数, 于是选择了直接交卷, 浪费了测试机会. 以及, 模型思考偏长, 而且暂时不支持调整思考强度, 加上普速接口现在异常火爆, 所以最好给大一些超时, 避免无法输出结果. 总结: MiMo-v2.6-Pro 适合搞后端AgenticCoding开发! 要算法有算法要质量有质量. 但是前端空间理解和美学还需要加强. 考虑到直播后训练的时候看到的67%的训练语料都是Coding, 这个结果丝毫不惊讶了. 希望下个版本前端能力也有提升! #mimo #mimov26 #mimov26pro #x小米mimo

karminski-牙医

12,658 views • 16 days ago