Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

给大家带来小米 MiMo-v2.6-pro 的测试速报! 简单来讲, 这次不愧是直播RL带来的效果, AgenticCoding 能力提升明显, 之前的 MiMo-v2.5-Pro 在我的向量数据库测试中得分只有2505, 而这次直接翻了3倍, 得分来到了7810. 与 Claude Fable-5 分数接近了. 而且算法也进化为了单图HNSW分层近邻图(M=16/M0=28) + AVX-512精确距离 + 每线程visited stamp. 可以说只要再优化一下算法细节就是SOTA水平了. 而前端测试则是MiMo需要提升的重点了, 这次演示效果虽然有提升, 但是无奈横评的其他模型都太强大了, 而小米的加分项也是本身的算法Coding能力, 比如它是可以 one-shot 写出一个光追引擎的. 但是由于空间理解/物理模拟能力不到位, 小球没办法完成把墙壁撞破的演示. 另外本次还给大家测试了输出速度, MiMo-v2.6-pro-ultraspeed 版本可以达到464tps的速度, 着实恐怖. 而根据MiMo的技术报告, 峰值可以达到900tps, 常态化请求也可以稳定在500tps左右, 考虑到模型 1.02T 的总参数量, 以及高达 42B 的激活参数量, 再加上同等规模模型一般都在60-80tps的水平, 这个成绩相当亮眼. 当然也有值得注意的点, 比如这次测试我发现它还是有早停的问题的,...

11,951 Aufrufe • vor 4 Tagen •via X (Twitter)

17 Kommentare

Profilbild von dreamlike_ocean
dreamlike_oceanvor 4 Tagen

我用2.6pro+opencode跑了一个 效果其实挺惨的。。。

Profilbild von karminski-牙医
karminski-牙医vor 4 Tagen

话说有对照组吗? 好奇其他模型能达到什么效果. 我这里AgenticCoding目前遇到最大的问题还是早停, 模型不是很愿意去用尽机会迭代.

Profilbild von dreamlike_ocean
dreamlike_oceanvor 4 Tagen

dpskv4.1flash蠢了一点但是不会操作互搏 思维链能体现在操作中吃一堑长一智 mimo模型在于思考到位了 他也知道怎么走但是输出之后下意识觉得已经完成了 感觉像是rl之后没有验收 这种概念

Profilbild von karminski-牙医
karminski-牙医vor 4 Tagen

Get, 我也测一下bug修复和复杂Agent场景

Profilbild von shieuhgdhs
shieuhgdhsvor 4 Tagen

实测垃圾的很

Profilbild von number leo
number leovor 4 Tagen

好多都测试了,垃圾刷分模型 你还在这里吹

Profilbild von 大冰
大冰vor 4 Tagen

用的api还是官方订阅?

Profilbild von 唐伯鱼-AI
唐伯鱼-AIvor 4 Tagen

请问你用的哪个harness?

Profilbild von Jinhao Pan
Jinhao Panvor 4 Tagen

用了一下,效果还不错

Profilbild von Claude Qin
Claude Qinvor 4 Tagen

还得是肥波5.1啊

Profilbild von Leaf
Leafvor 4 Tagen

看起来 mimo 非常不稳定,我测试了两次大象牙膏,都出现了不同程度的大问题,一次 mimo 客户端,一次 codex

Profilbild von laoshi
laoshivor 4 Tagen

文本生成能力如何?我在找一个替代Deepseek V4 Pro的作为我工作流最后那一步的文本生成器

Profilbild von karminski-牙医
karminski-牙医vor 4 Tagen

没测哎,我只测了编程

Profilbild von Neno
Nenovor 4 Tagen

说实话 这思考不像“偏长”了 我接codex一轮差不多10wtoken左右的思维链输出 根本看不见多少正文和工具调用

Profilbild von Pandener
Pandenervor 4 Tagen

请问一下是用的什么 Agent?是小米自己的桌面版吗?

Profilbild von 景哥|AI落地与智能体实践
景哥|AI落地与智能体实践vor 4 Tagen

MiMo这次最值得关注的不是刷了多少分,而是RL开始真正围绕“Agent怎么干活”训练。模型竞争正在从参数规模,转向RL×环境×Harness

Profilbild von hao
haovor 4 Tagen

他的思考 不是一点点长 是非常夸张的长

Ähnliche Videos

从国产SOTA走向世界SOTA? GLM-5.1 实测! 给大家带来 GLM-5.1 编程能力实测! 本次测试涵盖了前端, 后端, Agent 能力, 前端主要面向空间建模, 场景, 材质, 粒子效果等, 后端能力主要面向数据结构与算法, 体系结构, 性能优化, 内存和并发管理, 性能热点分析与调优, 面向编辑器方向的Agent能力(因为AI要自己改代码). 直接说结论, 本次测试前端方面粒子效果和光影鲜果略有提升, 剩下空间理解(甚至感觉下降了)和前端美学上没看到有什么提升, 只能说是提升了一点点. 但是后端性能上有巨大的提升, GLM-5.1 在我的 vector-db-bench 中直接秀了一手量化, 把原本32bit精度的数据量化到了8bit, 然后使用SIMD实现了一个指令周期内计算32个向量, 在我测试的其他模型中(包括Claude-opus-4.6, GPT-5.4-Pro(xhigh)) 都没有实现, 直接来到了榜首. 另外Agent能力上也有不小的提升, 同样是我写的让大模型模拟送外卖的硅基骑手测试, 其他大模型的优化还停留在看一个店能不能取两单上, GLM-5.1 已经优化到了我送餐的顺路还能再接一单, 并且仅用了大概GLM-5 1/4的 token 用量就超越了 GLM-5 的测试总分. 当然本次测试过程也很坎坷, 首先是我周末抢了2天都没抢到 coding plan (目前只有coding plan 能用这个模型), 我最后找智谱的同学给我开了个权限. 以及测试中发现白天API不是很稳定, 偶尔输出速度会掉到10tps, 以及会出现乱码文字(我的规避方法是让它输出英文, 然后再找个便宜模型翻译过来). 总结, 各位前端同学估计会失望, 因为无论是从工程还是页面效果上都看不到提升, 甚至可能会有点倒退, 但果写后端代码或者复杂Agent应用可以试试这个新模型, 会有很大的提升. #GLM51 #智谱 #GLM #AIAgent #大模型编程

karminski-牙医

19,683 Aufrufe • vor 6 Monaten

给大家带来 MiniMax-M3 实测! 本次测试包含了复杂前端, 后端 Agentic Coding, Agent 能力测试, 以及我的使用经验总结. 来看结论: 前端能力上, 可以完全适配 KCORES2026p2 的前端测试题目, 无论是空间理解, 建模精确度, 场景美学都十分在线, 其中我最满意的是美学部分, 它的颜色运用非常好. 不足的地方主要体现在复杂需求不能一次性写对(比如光追引擎), 需要迭代一下就可以了. 后端能力测试这次也是突飞猛进, 得分超过了 deepseek-v4-pro 和其他一众国产大模型, 略逊于 GPT-5.4-Pro(xhigh). Agent 能力上表现同样亮眼, 达成了榜单第二的接单量, 证明它的规划能力特别强。 下面是我在测试和实际使用中, 总结出来的 M3 使用经验, 供大家参考: 我的体感是 M3 特别喜欢推理, 它可以单次执行超长的推理. 在咱们的这些前端测试中, 它最长的输出甚至达到了我规定的 64k token上限, 所以, 不要上来就写一个超级复杂的 prompt 让它执行, 而是需要先把需求形成 plan, 然后让 agent 蜂群去执行, 这样才能得到理想的效果, 所以 M3 先天适合放在带 plan 模式的 Coding Agent 中使用. 如果把它嵌入到 Agent 框架中使用, 那么 prompt 编排就一定要做好, 不要一股脑把大量的 tool call 或者超大的 system prompt 丢给它. 还是需要下功夫好好编排一下的. 本次 M3 相比之前的 2.7 版本有了大幅度的提升, 模型偏好上来看, M3 是一个规划能力极强的模型, 所以特别适合用在一些规划性质的 Agent 框架中, 比如任务拆分, 日程管理, 流程设计等. 而本次暴露出来的不足则是执行过程中约束不够强, 比如 prompt 中设置的复杂规则, 一定要增加代码级别的 harness 闭环流程来进行约束, 而不能只靠模型本身来管理自己的行为. #minimaxm3 #minimax #agenticcoding #aiagent #harness

karminski-牙医

18,950 Aufrufe • vor 3 Monaten

GPT-5.2 实测! 美是真的美, 卡是真的卡 给大家带来 GPT 5.2 thinking 和 pro 的测试结果: 说实话, 这两个模型差距并不大, 但是价格却差了11倍. 大象牙膏测试, 这个感觉退步了, 甚至不如 GPT 5, 而且粒子效果还不如国产开放权重模型. 鞭炮连锁爆炸测试, 建模和光照, 粒子效果都非常好, 但追求画质的结果就是牺牲性能, 两个模型在测试中都非常的卡, 甚至 GPT 5.2 pro 尝试使用52个纹理, 而 WebGL 2.0 规范只支持16个. 所以不但会卡而且还报错. 陀飞轮机芯测试, 这个应该是目前的 SOTA, 齿轮效果, 光照, 建模准确性都不错. python 杯子倒水测试毫无进步, 跟 GPT5 没区别 总结, 新的模型还是更注重在美学上发力, web界面的风格很统一, 光影效果也是SOTA, 但是具体编程上没有看到特别大的进步, 尤其是 python. 另外, 这两个模型大概率都有 three.js 的包导入错误, 所以大型工程场景表现需要谨慎. 以及本次测试 gpt 5.2 thinking 每个测试运行6次取最好结果, 花了我3.88刀(就写了18个网页和6个python脚本), 而 gpt 5.2 pro 由于太贵了, 每个测试我只运行了一次, 就这样还花费了我7.12 刀(3个网页1个python脚本...). 所以推荐大家如果需要极致美学的场景, 可以考虑使用 gpt 5.2 thinking, 其他编程场景如果没有订阅, 还是谨慎, 毕竟太贵了. #GPT52 #GPT #OpenAI

karminski-牙医

31,685 Aufrufe • vor 9 Monaten

抱歉我们只有超大杯! GLM-4.7实测! 本次测试覆盖了GLM-4.7的编程能力, Agent/ToolCall能力, 长上下文召回能力, 给大家带来刚发布的 GLM 4.7 的测试结果: 考验Agent能力的硅基骑手测试, 简单讲是让大模型使用工具模拟骑手取外卖送餐. GLM 4.7 在24小时总计300回合的极限送餐中收益达到了 571.91 元, 执行了总计 354 次 tool call, 测试使用了大约 50% 的上下文空间, 直到超过100K后才停止工作. Agent 测试这次是创了新高, 执行效率特别高, 得益于模型可以在一次会话中发起多个 tool call, 节省了时间并能选择收益最大的方案. 然后是考验长上下文召回能力的霍格沃茨测试, 简单来讲就是在长上下文中, 能否记住上下文并准确的回答问题. GLM 4.7 在192K以内召回水平在91%到100%区间, 而200K也有95%, 召回效果同样也很不错. 最后再来看编程能力测试上最大的感受是粒子, 建模, 光影效果都有提升, 尤其是空间能力有了巨大的提升. 当然性能问题仍然存在, 希望下个版本着重优化下生成代码的性能问题. 总结, 这次GLM 4.7 在各个方面都有明显的提升, 作为主力编程模型不是问题, LMArena 和 SWE-bench 等编程测试中都取得了开源大模型 SOTA 的水平. 不过还是要说一句, 测试中我发现API速度时快时慢, 是不是因为大家都在用新版本导致的? 希望官方赶紧加机器. #GLM47 #智谱AI #智谱GLM #AIAgent #ai编程 #大模型 #开源 #KCORES大模型竞技场

karminski-牙医

19,592 Aufrufe • vor 9 Monaten

Qwen3-Next-80B-A3B 实测! 能跟头部模型对打吗? 直接说结论, 能完成我这个大象牙膏测试的一部分, 已经很厉害了, Python 杯子倒水那个测试表现也可圈可点. 来看测试中暴露出来的问题: 首先这个模型生成的样式特别多变, 可以看测试中生成的前端页面的样式和布局, 几乎每次都不一样. 所以实际使用中, 可能会存在稳定性的问题, 建议 prompt 中多做约束, 避免模型过度发挥. 不过这并不全是坏处, 如果拿这个大模型写文, 反而可能会超常发挥, 每次写出来的东西都不一样, 不会呆板. 另外目前发现最大的问题是, 给到模型一大堆数据, 让模型整理一个网页, 结果模型偷懒了, 直接把代码和数据省略掉了, 这个应该还是 GPT-4 时代的问题 (24年上半年) 出现了. 这里猜测可能是高稀疏性专家混合模型或者多词元预测造成的问题, 这两个都会在生成中选择最经济的生成模式, 因此可能会倾向于生成"此处代码省略"这样的代码来替代原本要生成一大堆代码的场景. 召回倒是没太大问题, 鞭炮连锁爆炸那个测试, 虽然模型没有成功写出来, 但是最长的一次还是生成了1100行代码, 我仔细看了下, 基本都考虑到了我 prompt 中要求的逻辑, 只不过实现的代码有 bug 跑不起来而已. 综合来讲, 我觉得这应该是 100B 以内的模型无敌手了, 考虑到定位可能是个新的技术试验模型, 所以期待千问推出更大规模 (例如400B-A15B) 的模型, 带来更好的性能. 测试 prompt: #Qwen3Next #大模型竞技场 #Qwen3

karminski-牙医

30,709 Aufrufe • vor 1 Jahr

Qwen3.5实测!来看贺岁档大模型的实力! 贺岁档大模型来啦! Qwen3.5 这次支持了文本、图片、视频多模态输入, 本次准备了全新的后端能力测试! 以及照例带来前端能力、Agent、长上下文能力的全面测试! 来看本次新增的后端编程测试 vector DB Bench: 要求大模型从零实现一个高性能向量数据库, 只给提示词不给实现方案, 配合 coding agent 自动写代码、编译、跑分. 结果 Qwen3.5 直接甩出王炸 —— QPS 1405, 是 Kimi-K2.5 的 4.8 倍, GLM-5 的 25 倍! 关键在于它不仅用了 IVF 倒排索引 + AVX512F 指令集, 还在有限轮次内自主探索出了最优聚类参数 (K=2048, nprobe=30), 每次查询只需扫描约 15000 条数据, 而 Kimi-K2.5 的参数配比要扫描 75000 条, 正好解释了近 5 倍的性能差距. 这波调参堪称神之一手. 前端编程也有进步: 大象牙膏测试终于能正确建模三角烧瓶, 鞭炮连锁爆炸的粒子光影效果不错, 支持多模态后甚至可以对着网站录屏直接克隆. 但空间理解仍是短板, 陀飞轮机芯测试中齿轮设计暴露了差距. 指令遵循: 洛希极限测试中的指令遵循达到 85.9% (Gemini-3.0-Pro 为 90.6%), 主要扣分在未遵循加速曲线公式. Agent 能力: 硅基骑手测试得分 668.43, 仅次于 GLM-5 的 738.69, 也侧面解释了为什么后端编程 Agent 表现这么强. 长文本召回: 256K 上下文召回 99.1%, 但不给原文时四选一蒙对率高达 75.6%, 结果完全不置信. 总结: Qwen3.5 最亮眼的是后端编程能力, 同样的 IVF 算法靠调参拉开 5 倍差距, Agent 能力同样在线. 不过本次测试还发现了点小问题, 输出偶尔不太稳定, 会漏掉 markdown 语法或把答案输出到 thinking 标签里, 这点要注意, 目前我已经反馈给官方了. 这份新年礼物, 大家觉得怎么样? #Qwen #千问大模型 #Qwen35 #阿里千问 #通义实验室 #AIAgent #向量数据库

karminski-牙医

14,591 Aufrufe • vor 7 Monaten

白宫加密政策主管David Sacks: 四年内AI 大模型能力将增长一百万倍 ! “我认为目前至少在三个关键维度上,进步的速度都是指数级的。” “首先是算法本身。模型每年提升的速度大概是 3-4 倍。” “它们不仅仅是在速度和性能上更快更好,而且将从量变到质变。” “接着是推理模型。” “我们甚至还没有真正进入智能代理时代,但这将是继推理模型之后的下一个重大飞跃。” “在这个领域,我们才刚刚开始(推理算力增加带来的能力增加也将是倍数增长)。” “接下来是芯片。” “根据多种衡量标准,每一代芯片的性能可能比上一代提高 3-4 倍。” “不只是单个芯片在不断进步,他们还在研究如何将这些芯片联网在一起。” “就像 NVL72 系统,它类似于一个机架系统,可以在数据中心级别大幅提升性能。” “计算能力是第三个你会看到基本上呈指数级进步的领域。” “只需要看看数据中心中部署的 GPU 数量。” “当马斯克最初开始训练 Grok 时,我认为他们大概有 10 万块 GPU。现在已经有 30 万块 GPU,而且正朝着百万块 GPU的目标迈进。OpenAI 的数据中心 Stargate 也是同样的情况。” “在接下来的几年中,他们可能会发展到 500 万、1000 万块 GPU。” 1,000,000 倍的增长是怎么得出的: “算法、芯片和数据中心的扩展和改进速度都是每年 3-4 倍。” “也就是说,每两年进步 10 倍。” “很多人没有理解指数级进步的含义:如果每两年提升 10 倍,并不意味着四年后你只是提升 20 倍。” “这实际上意味着提升 100 倍。” “把这些因素相乘:算法、芯片,以及可用于 AI 的原始计算能力。” 100 倍模型 🧠 × 100 倍芯片 💾 × 100 倍计算能力 ⚡️ = 1,000,000 倍的 AI 大模型🤖 “你所谈论的就是 1,000,000 倍的能力增长。” “但这种变革的影响将是绝对巨大的。” “我觉得人们还没有充分认识到这一点,因为他们不了解指数级进步的意义。”

夜谈

25,895 Aufrufe • vor 1 Jahr