Loading video...

Video Failed to Load

Go Home

四大国产 AI 代码模型极限实测,速度差距大到离谱 同一个任务,计时从下指令到代码跑出结果: MiniMax M3:47秒 Kimi K2.7 Code:51秒 MiMo v2.5 Pro:87秒 GLM 5.2 Max:21分钟 没看错,最快和最慢差了24倍 GLM 官方解释是"全量代码预校验",听着很高级。但说白了就是生成完代码自己又从头检查一遍才输出。21分钟,用户等到手机都锁屏了 严谨是好事,但你得给用户选择权。想快的时候让我快,想稳的时候再帮我查。不能一刀切全做成21分钟 MiniMax 和 Kimi 都在一分钟内搞定了。AI 代码生成这种场景,快就是正义。你一分钟出结果有bug我改一下就行,你21分钟出结果没bug我也等不起 国产代码模型的第一梯队已经很能打了,但差距也是肉眼可见的

34,689 views • 1 month ago •via X (Twitter)

0 Comments

No comments available

Comments from the original post will appear here

Related Videos

MiMo推出1000 Token/s超高速模型|体验测评 MiMo 推出了 MiMo V2.5 Pro UltraSpeed 超高速的模型版本,能够实现每秒输出超过 1,000 Token 的速度。 同时,这应该也是全球第一个达到这个速度的万亿(1T)参数模型。 藏师傅提前试了一下,做了三个测试,确实爽。 第一个跑了一个比较复杂的 3D 采矿小游戏测试。在没有素材的情况下,我让它全部用 Three.js 前端代码来生成素材。整体要求比较完整,虽然第一次实践时出了一些小问题,但在跟他沟通修改建议后,非常完美地实现了任务。 这次测试的各项指标如下:思考的 TPS:804 Token/s,峰值速度:810 Token/s,首次响应时间:4.71 秒。 第二个测试给了一个官网,其头部包含一个相对复杂的 3D 动画。 这次的输出速度快了非常多:峰值达到了 1426 Token/s,首次响应只用了 0.83 秒,在 32 秒内输出了 25624 个 Token,总计生成了 1000 行代码。 第三个测试给了一个更复杂的官网。我要求这个官网的 Header 头部包含以下 3D 效果:地球边缘、轨道上的飞船、星际尘埃、航线图、舷窗的 HUD 样式。 这个效果非常好,整体的视觉样式、状态、SVG 动画和驾驶卡片都非常精细,还有滚动的视差效果 这个输出的 TPS 达到了 1136 tokens/s,首次响应是 4.5 秒 官方测试平台下面有个数据展示,会显示相关信息 在流式输出的情况下,当你看着它只用 20 秒就产生一个非常复杂的 3D 游戏时,那种场景还是比较震撼的 之前的这些(比如说 Groq 之类的)超高速推理方案,在模型能力或者是整体水平上都会有所下降,但是 MiMo 这个在测试的时候,我没有看到这种迹象 最近很多公司都开始推出这种超高速的 API 服务,比如之前 OpenAI 和 Anthropic 都有 Fast 模式 在 Agent 场景下,模型输出效率的提升会直接带动每一步 Agent 操作的效率: 如果一个任务预估一分钟完成,你就会盯着它直到结束,然后立刻投入测试。如果需要五分钟才完成,你可能就会去干别的事,然后再回来看,难免会浪费一些时间 这种效率提升在 Sub-Agent 和并发场景下更加明显。因为它可以更快地产出大量结果,想象一下,如果同时启动一两百个 Sub-Agent,在模型能力没有衰减的前提下,速度提高 10 倍,体验是非常爽的 毕竟这本质上是面向那种对效率有极高要求的 To B 客户所推出的 希望后面大家卷起来,优化一下成本,让普通用户也能放开用这种 UltraSpeed 模型

歸藏(guizang.ai)

26,998 views • 1 month ago

Claude有个很让人不爽的点!! 每次新模型发布,官方非订阅用户连体验的资格都没有!! 想起之前在 ZenMux 充了钱还没用完,登上去一看,没想到已经上架了Claude Fable 5 , 也算是第一时间体验上了这个“目前最强模型”。 听说这模型死贵!! 于是很慎重的用它跑了一个支付模块重构的任务! 零代码基础,只能把之前Codex的输出给复制进去, 任务要求比较复杂: 保持原 API 兼容; 拆出 PaymentRequested / PaymentSucceeded / PaymentFailed; 补幂等,避免重复扣款; 改状态机; 更新单测; 输出迁移风险; Fable 5 不算快,面对这个长任务,它做对了两件事: 第一,先拆计划,再执行。 它把兼容层、事件定义、状态机、handler、测试、回滚风险都列出来了。 第二,最后主动自检。 它自己指出:支付成功事件必须幂等;旧接口“返回成功”不再等于“扣款完成”,调用方文档要改。 结果看起来,还是一如既往的稳! 但是真的贵,就这么几分钟,直接跑了十多美金!! 所以,我觉得要是家里没有矿,还是不要随便用Fable 5 ,根本不适合当常驻模型! 感谢Zenmux让我体验了一下“宇宙最强”! 虽然有点贵,但有时候相比价格,省心省力会更重要。 比如多文件重构、复杂迁移、PR review、长链路 Agent workflow这些复杂任务,偶尔用用,还是可以的! 最后说一下 Zenmux,它有个PK 模式我一直很喜欢,可以同屏对比多个模型输出、延迟和成本。 现在刚好还有个限时的充值返赠活动: 充 20 美元送 10 美元 充 50 美元送 30 美元 如果你想第一时间体验Claude Fable 5或者其他模型,现在就是下手的最好时间!

沐阳

15,442 views • 1 month ago

卧槽,答案终于揭晓了! 那个在open router上持续霸榜的神秘模型,是阿里推出的全新大模型“蚂蚁百灵”!今天我们来深度聊一聊这个模型。 用过AI来完成前端开发的朋友肯定懂: 要让AI做出想要的UI总是要找参考,再不然就是要依赖设计 skill 的帮助。 但这种界面一旦看多了,就会陷入审美疲劳。 原因在于不管你是对标UI还是使用skill,结果都是被限定在固有的生成范围内。 最近小灰测了新模型 Ling-2.6-1T (由蚂蚁集团 Ant Ling 开发),发现它刚好就能打破这个限制。 它生成的页面不仅审美极度在线,而且自带高质量的交互效果,做出来的东西终于不再是干巴巴的呆板网页了。 但用它有个必须要避开的坑:Ling 2.6 1T 默认是没有深度思考模式的。 它在计算资源分配上极其克制,如果你偷懒丢一句"给我写个好看的界面",那么它大概率会给你一个准确但极其敷衍的结果。(视频1) 那么怎么取巧使用它? 小灰分享一个能逼出它真实设计水平的实操工作流:把它当成主规划师,先拆解风格,再写代码。 跟它对话时,你可以直接下这种指令: 1. 强制思考:先别急着写代码!帮我分析这个产品的定位,明确它的视觉情绪、色彩规范和排版布局,把思路列出来。(比如明确告诉它你要包豪斯风格或者北欧风)。 2. 落地执行:等它把设计语言梳理清楚,你确认没问题了,再让它基于这套标准去生成具体的 TailwindCSS 样式和前端页面。 用这种先 Plan 后做的方式,出来的页面不仅美观,而且风格极其统一。(视频2) 目前在Openrouter中可以免费体验该模型。 选对工具打破模板限制,用高审美的模型直接拔高视觉质感,能帮我们省下大把死磕 CSS 的时间。 期待大家都能快速做出让人眼前一亮的作品!

程序员小灰

15,021 views • 3 months ago

我尼玛,Claude Fable 5今天把整个软件行业的底层逻辑给击穿了! 以前做软件要几个月,现在只要15分钟,Claude Fable 5把产品经理和程序员的中间环节,直接干掉了。 也就是说,15分钟的销售电话打完, AI当场做出了客户要的可运行软件原型,喵个咪,这谁受得了啊🤯 Todd Saunders,Dalton Mills AI 的 CEO,做的是 trades 行业的垂直 SaaS——建筑、家政、暖通这些。 他用刚发布的 Claude Fable 5, 在跟一个客户的销售电话里, 让 AI 在后台实时转录通话, 同时自主构建客户刚刚提到的软件功能。 通话结束,他当场演示了一个完全可运行的原型,精确匹配客户 15 分钟前描述的需求。 一个语音报价系统:AI 实时听服务电话,自动匹配价目表,识别 upsell 机会,生成 Good/Better/Best 三档方案,自动发提案短信。整个过程近乎零人工干预。 不是 简单的AI 辅助开发,直接对话即构建,damn! 平复下激动的心情,这个案例最让我震惊的不只是AI 写代码快,AI 真的能听懂人话了啊啊啊, 然后一个长达几十年的产品开发范式,就这么被直接击穿了,holy sh*t! 想一想过去几十年我们怎么干活的,客户跟你说工人在现场太乱经常算错钱,你记下来,回去消化,以为懂了, 画原型,约评审,排期,开发,几周后拿出来, 客户摇头说不对不是这么回事, 你一肚子委屈,说我每个字都记了,他说你记的是我说的话,不是我脑子里的东西。 这个循环叫理解-翻译-验证,短则几周长则几个月,整个行业就吃这碗饭的,我们管它叫专业服务。 但是今天,Fable 5 把这个循环干掉了,不是压缩啊兄弟们,直接彻底干掉了, 客户说,AI 听,AI 当场做出来,客户当场看对不对, 没有 PRD,没有你在内部群里发那个需求我回去评估一下,没有一切中间件, 从客户嘴里说出来的那一刻,一个能跑的东西就在屏幕上等着他。 这才是真正要命的地方,这哪是提效啊,简直把整个底层逻辑都改变了。 但我们也必须立刻面对一个最尖锐的问题,就是那客户为什么还需要你?这不就 15 分钟的事吗? 这个问题必须正面面对,确实是客观存在的, 如果你对自己的定位只是把客户需求翻译成代码的那个人,那你完全可以被这 15 分钟取代,因为 AI 现在翻译得比你快,还不用开评审会。 但如果你做完项目就知道,原型和系统,中间隔着的不是几行代码,还有权限体系里那几十个你不知道为什么会存在的字段, 是客户二十年前的财务系统里藏着的那个没人敢动的数据表,是工人在负二层没信号的地方操作时该怎么缓存,也是某个老小区因为水压问题装不上你方案里那个完美的配件, 又或者是当地监管对报价条款里的某个措辞有特殊要求,这些东西,Fable 5 不知道,你问它它也不知道,它甚至不知道它不知道。 它的原型是乐高模型,系统是能住人的楼,之间的差距,专业术语叫工程判断,也可以叫领域责任,更可以叫为长期可用性兜底。 所以这个案例真正揭示的,不是谁会被替代,是什么在剧烈地变稀缺。 第一样,把 AI 的生成能力锚定在真实世界的复杂约束里, 这一下子就筛掉两种人:只会做原型不会做系统的人,和只会做系统但不懂行业的人。 留下的是那种,你问他这个需求能不能做,他会先问你那边现场平均信号几格、工人习惯左手拿手机还是右手、他们现在用的那个老系统数据库编码是 UTF-8 还是 GBK 的人。 第二样,领域知识, 我说的不是行业报告里那些漂亮话,是那些只有在这个行业干了十年才知道的脏东西。 AI 能生成完美的三档报价界面,但它不知道某个配件的供应商在雨季会涨价 30%,不知道某个话术在北方好使在南方会让客户挂电话,不知道这个工种的师傅脾气大你不能在流程里多加一步确认否则他宁愿不干,这些脏知识才是真正的护城河。 第三样,也是最被低估的一样:把原型变成可信赖系统的治理能力。 评估框架你怎么建,AI 改了这一处你怎么知道没把另一处改坏。 记忆持久化你怎么做,客户上次改的需求下次对话能不能记住。 错误恢复你怎么设计,流程跑到一半 AI 崩了用户看到什么。 多代理协作你怎么编排,一个 Agent 听电话提取意图,一个匹配价目表,一个检查合规,一个生成界面,人类在哪个节点介入裁决。 这些东西不酷,开会聊这些会让人想抽烟,但就是从酷到能用的最后那一公里。 Fable 5 和后续更强的模型,把生成这件事的成本和速度打到了一个新的量级。 这个量级意味着,做出一个看起来能用的东西,以后不再是任何人的竞争力。竞争的分水岭是,谁能把 AI 吐出来的东西,变成一个别人敢在上面跑业务、能长期依赖、出了问题找得到人负责的系统。 扯了这么多,最后一句话给大家共勉: 从今天起,把 80% 的精力,从怎么让 AI 生成得更快,转移到怎么为 AI 生成的东西负责,说白了,酷是给外人看的,稳是给我们自己续命的。

AYi

22,475 views • 1 month ago