Video yükleniyor...

Video Yüklenemedi

Ana Sayfaya Dön

四大国产 AI 代码模型极限实测,速度差距大到离谱 同一个任务,计时从下指令到代码跑出结果: MiniMax M3:47秒 Kimi K2.7 Code:51秒 MiMo v2.5 Pro:87秒 GLM 5.2 Max:21分钟 没看错,最快和最慢差了24倍 GLM 官方解释是"全量代码预校验",听着很高级。但说白了就是生成完代码自己又从头检查一遍才输出。21分钟,用户等到手机都锁屏了 严谨是好事,但你得给用户选择权。想快的时候让我快,想稳的时候再帮我查。不能一刀切全做成21分钟 MiniMax 和 Kimi 都在一分钟内搞定了。AI 代码生成这种场景,快就是正义。你一分钟出结果有bug我改一下就行,你21分钟出结果没bug我也等不起 国产代码模型的第一梯队已经很能打了,但差距也是肉眼可见的

35,148 görüntüleme • 3 ay önce •via X (Twitter)

0 Yorum

Yorum bulunmuyor

Orijinal gönderinin yorumları burada görünecek

Benzer Videolar

MiMo推出1000 Token/s超高速模型|体验测评 MiMo 推出了 MiMo V2.5 Pro UltraSpeed 超高速的模型版本,能够实现每秒输出超过 1,000 Token 的速度。 同时,这应该也是全球第一个达到这个速度的万亿(1T)参数模型。 藏师傅提前试了一下,做了三个测试,确实爽。 第一个跑了一个比较复杂的 3D 采矿小游戏测试。在没有素材的情况下,我让它全部用 Three.js 前端代码来生成素材。整体要求比较完整,虽然第一次实践时出了一些小问题,但在跟他沟通修改建议后,非常完美地实现了任务。 这次测试的各项指标如下:思考的 TPS:804 Token/s,峰值速度:810 Token/s,首次响应时间:4.71 秒。 第二个测试给了一个官网,其头部包含一个相对复杂的 3D 动画。 这次的输出速度快了非常多:峰值达到了 1426 Token/s,首次响应只用了 0.83 秒,在 32 秒内输出了 25624 个 Token,总计生成了 1000 行代码。 第三个测试给了一个更复杂的官网。我要求这个官网的 Header 头部包含以下 3D 效果:地球边缘、轨道上的飞船、星际尘埃、航线图、舷窗的 HUD 样式。 这个效果非常好,整体的视觉样式、状态、SVG 动画和驾驶卡片都非常精细,还有滚动的视差效果 这个输出的 TPS 达到了 1136 tokens/s,首次响应是 4.5 秒 官方测试平台下面有个数据展示,会显示相关信息 在流式输出的情况下,当你看着它只用 20 秒就产生一个非常复杂的 3D 游戏时,那种场景还是比较震撼的 之前的这些(比如说 Groq 之类的)超高速推理方案,在模型能力或者是整体水平上都会有所下降,但是 MiMo 这个在测试的时候,我没有看到这种迹象 最近很多公司都开始推出这种超高速的 API 服务,比如之前 OpenAI 和 Anthropic 都有 Fast 模式 在 Agent 场景下,模型输出效率的提升会直接带动每一步 Agent 操作的效率: 如果一个任务预估一分钟完成,你就会盯着它直到结束,然后立刻投入测试。如果需要五分钟才完成,你可能就会去干别的事,然后再回来看,难免会浪费一些时间 这种效率提升在 Sub-Agent 和并发场景下更加明显。因为它可以更快地产出大量结果,想象一下,如果同时启动一两百个 Sub-Agent,在模型能力没有衰减的前提下,速度提高 10 倍,体验是非常爽的 毕竟这本质上是面向那种对效率有极高要求的 To B 客户所推出的 希望后面大家卷起来,优化一下成本,让普通用户也能放开用这种 UltraSpeed 模型

歸藏(guizang.ai)

27,376 görüntüleme • 3 ay önce

Claude有个很让人不爽的点!! 每次新模型发布,官方非订阅用户连体验的资格都没有!! 想起之前在 ZenMux 充了钱还没用完,登上去一看,没想到已经上架了Claude Fable 5 , 也算是第一时间体验上了这个“目前最强模型”。 听说这模型死贵!! 于是很慎重的用它跑了一个支付模块重构的任务! 零代码基础,只能把之前Codex的输出给复制进去, 任务要求比较复杂: 保持原 API 兼容; 拆出 PaymentRequested / PaymentSucceeded / PaymentFailed; 补幂等,避免重复扣款; 改状态机; 更新单测; 输出迁移风险; Fable 5 不算快,面对这个长任务,它做对了两件事: 第一,先拆计划,再执行。 它把兼容层、事件定义、状态机、handler、测试、回滚风险都列出来了。 第二,最后主动自检。 它自己指出:支付成功事件必须幂等;旧接口“返回成功”不再等于“扣款完成”,调用方文档要改。 结果看起来,还是一如既往的稳! 但是真的贵,就这么几分钟,直接跑了十多美金!! 所以,我觉得要是家里没有矿,还是不要随便用Fable 5 ,根本不适合当常驻模型! 感谢Zenmux让我体验了一下“宇宙最强”! 虽然有点贵,但有时候相比价格,省心省力会更重要。 比如多文件重构、复杂迁移、PR review、长链路 Agent workflow这些复杂任务,偶尔用用,还是可以的! 最后说一下 Zenmux,它有个PK 模式我一直很喜欢,可以同屏对比多个模型输出、延迟和成本。 现在刚好还有个限时的充值返赠活动: 充 20 美元送 10 美元 充 50 美元送 30 美元 如果你想第一时间体验Claude Fable 5或者其他模型,现在就是下手的最好时间!

沐阳

15,442 görüntüleme • 3 ay önce

卧槽,Google/DeepMind 团队最新演示的 AI 递归自我改进论文有点吊炸,奇点要来了吗!? 以前让 Agent 去探索一个复杂的算法或 GPU 算子,每试错一次就要花几十美分、还要等编译跑分,钱包根本扛不住。 谷歌 Dream-RSI 的思路变了:它让模型在过去的历史日志里做梦,用极低成本试完几千种打法,选出最好的再上线实测。 早上好好看了下,发现DeepMind 这篇 Dream-RSI 最值钱的突破其实还不只是让 AI 去修改自身权重, 他们终于找到了一种办法,把调用大模型做探索的成本直接打掉了最高 162 倍。 对正在做代码智能体、自动科研和算法优化的人来说,这篇论文给出了一个极度清醒的工程底座。 它的思路非常克制,一共踩实了三步: 1️⃣ 冻结模型权重,只改战术打法 科幻小说里的自进化,往往是让模型自己改自己的底层代码或权重,结果往往是灾难性遗忘和幻觉暴增; 谷歌第一步就把安全阀焊死了:底层的大模型完全固定不动,它只负责干活; 自我改进的对象,是指导模型去哪里搜索、什么时候回溯、怎么选分支的探索策略。 2️⃣ 把历史残局做成做梦模拟器 这是全篇最聪明的一步。 以前让 Agent 探索长链条任务,最昂贵的是每一步都要真机运行、在线打分; Dream-RSI 把过去跑完的探索轨迹存成了一棵不可篡改的历史树; 这棵树就是环境模拟器,系统可以在离线状态下疯狂做梦,把成千上万种新的探索打法放在历史数据上快速过一遍, 既不需要重新调用大模型生成一遍内容,也不用重复去跑耗时的编译器。 3️⃣ 用历史教训筛选出最佳策略再实战 在沙盒里挑选出得分最高的探索策略后,才把它装载到下一轮真实的业务环境里; 在数学优化、算法设计和 GPU 内核优化的测试中,它不仅拿到了持平甚至更好的方案, 还把在线调用大模型的次数砍到了原本的几十分之一,特定测试下甚至减少了 162 倍。 但看这篇论文必须看清它的取信边界: 这种自我进化之所以成立,是因为算法和 GPU 代码有着极其冷酷的判定器,能不能编译、运行速度快了多少,物理世界会给出绝对确定的分数; 如果换成写文章、做设计等没有客观真理裁判的场景,做梦机制会瞬间退化成自我陶醉的幻觉堆叠。 真正的智能化突破,往往不是靠盲目堆算力去穷举试错; 模型的能力可以固定,但通过沉淀过去的失败轨迹、用最低的代价把搜索战术打磨到极致, 这套把经典强化学习移植进 Agent 系统的框架,给很多被高昂 API 账单卡住的团队,指了一条极其实在的生路。

AYi

27,665 görüntüleme • 13 gün önce