Video wird geladen...
Video konnte nicht geladen werden
给大家带来小米 MiMo-v2.6-pro 的测试速报! 简单来讲, 这次不愧是直播RL带来的效果, AgenticCoding 能力提升明显, 之前的 MiMo-v2.5-Pro 在我的向量数据库测试中得分只有2505, 而这次直接翻了3倍, 得分来到了7810. 与 Claude Fable-5 分数接近了. 而且算法也进化为了单图HNSW分层近邻图(M=16/M0=28) + AVX-512精确距离 + 每线程visited stamp. 可以说只要再优化一下算法细节就是SOTA水平了. 而前端测试则是MiMo需要提升的重点了, 这次演示效果虽然有提升, 但是无奈横评的其他模型都太强大了, 而小米的加分项也是本身的算法Coding能力, 比如它是可以 one-shot 写出一个光追引擎的. 但是由于空间理解/物理模拟能力不到位, 小球没办法完成把墙壁撞破的演示. 另外本次还给大家测试了输出速度, MiMo-v2.6-pro-ultraspeed 版本可以达到464tps的速度, 着实恐怖. 而根据MiMo的技术报告, 峰值可以达到900tps, 常态化请求也可以稳定在500tps左右, 考虑到模型 1.02T 的总参数量, 以及高达 42B 的激活参数量, 再加上同等规模模型一般都在60-80tps的水平, 这个成绩相当亮眼. 当然也有值得注意的点, 比如这次测试我发现它还是有早停的问题的,... show more
11,951 Aufrufe • vor 4 Tagen •via X (Twitter)
17 Kommentare

dreamlike_oceanvor 4 Tagen
我用2.6pro+opencode跑了一个 效果其实挺惨的。。。

karminski-牙医vor 4 Tagen
话说有对照组吗? 好奇其他模型能达到什么效果. 我这里AgenticCoding目前遇到最大的问题还是早停, 模型不是很愿意去用尽机会迭代.

dreamlike_oceanvor 4 Tagen
dpskv4.1flash蠢了一点但是不会操作互搏 思维链能体现在操作中吃一堑长一智 mimo模型在于思考到位了 他也知道怎么走但是输出之后下意识觉得已经完成了 感觉像是rl之后没有验收 这种概念

karminski-牙医vor 4 Tagen
Get, 我也测一下bug修复和复杂Agent场景

shieuhgdhsvor 4 Tagen
实测垃圾的很

number leovor 4 Tagen
好多都测试了,垃圾刷分模型 你还在这里吹

大冰vor 4 Tagen
用的api还是官方订阅?

唐伯鱼-AIvor 4 Tagen
请问你用的哪个harness?

Jinhao Panvor 4 Tagen
用了一下,效果还不错

Claude Qinvor 4 Tagen
还得是肥波5.1啊

Leafvor 4 Tagen
看起来 mimo 非常不稳定,我测试了两次大象牙膏,都出现了不同程度的大问题,一次 mimo 客户端,一次 codex

laoshivor 4 Tagen
文本生成能力如何?我在找一个替代Deepseek V4 Pro的作为我工作流最后那一步的文本生成器

karminski-牙医vor 4 Tagen
没测哎,我只测了编程

Nenovor 4 Tagen
说实话 这思考不像“偏长”了 我接codex一轮差不多10wtoken左右的思维链输出 根本看不见多少正文和工具调用

Pandenervor 4 Tagen
请问一下是用的什么 Agent?是小米自己的桌面版吗?

景哥|AI落地与智能体实践vor 4 Tagen
MiMo这次最值得关注的不是刷了多少分,而是RL开始真正围绕“Agent怎么干活”训练。模型竞争正在从参数规模,转向RL×环境×Harness

haovor 4 Tagen
他的思考 不是一点点长 是非常夸张的长
