Loading video...

Video Failed to Load

Go Home

Qwen 推理性能最高提升8倍! 这个 DFlash 前几天看到了,感觉就是以前的speculative decoding,结果今天看到有人加了 DDTree 技术。 实际就是把 speculative decoding 的单链 draft 变成树状draft + Tree Attention 一次验证 + 最长匹配 prefix commit。 目的是不让 draft 模型在 branching point 的预测被浪费, DFlash 每个 position 只留一个预测,DDTree 则保留多个,再让 target 模型一次看完挑哪个对。 直接让 Qwen3-30B-MoE 在 HumanEvalT 实现了 8.22 倍速度提升!

38,801 views • 4 months ago •via X (Twitter)

0 Comments

No comments available

Comments from the original post will appear here

Related Videos

MiMo推出1000 Token/s超高速模型|体验测评 MiMo 推出了 MiMo V2.5 Pro UltraSpeed 超高速的模型版本,能够实现每秒输出超过 1,000 Token 的速度。 同时,这应该也是全球第一个达到这个速度的万亿(1T)参数模型。 藏师傅提前试了一下,做了三个测试,确实爽。 第一个跑了一个比较复杂的 3D 采矿小游戏测试。在没有素材的情况下,我让它全部用 Three.js 前端代码来生成素材。整体要求比较完整,虽然第一次实践时出了一些小问题,但在跟他沟通修改建议后,非常完美地实现了任务。 这次测试的各项指标如下:思考的 TPS:804 Token/s,峰值速度:810 Token/s,首次响应时间:4.71 秒。 第二个测试给了一个官网,其头部包含一个相对复杂的 3D 动画。 这次的输出速度快了非常多:峰值达到了 1426 Token/s,首次响应只用了 0.83 秒,在 32 秒内输出了 25624 个 Token,总计生成了 1000 行代码。 第三个测试给了一个更复杂的官网。我要求这个官网的 Header 头部包含以下 3D 效果:地球边缘、轨道上的飞船、星际尘埃、航线图、舷窗的 HUD 样式。 这个效果非常好,整体的视觉样式、状态、SVG 动画和驾驶卡片都非常精细,还有滚动的视差效果 这个输出的 TPS 达到了 1136 tokens/s,首次响应是 4.5 秒 官方测试平台下面有个数据展示,会显示相关信息 在流式输出的情况下,当你看着它只用 20 秒就产生一个非常复杂的 3D 游戏时,那种场景还是比较震撼的 之前的这些(比如说 Groq 之类的)超高速推理方案,在模型能力或者是整体水平上都会有所下降,但是 MiMo 这个在测试的时候,我没有看到这种迹象 最近很多公司都开始推出这种超高速的 API 服务,比如之前 OpenAI 和 Anthropic 都有 Fast 模式 在 Agent 场景下,模型输出效率的提升会直接带动每一步 Agent 操作的效率: 如果一个任务预估一分钟完成,你就会盯着它直到结束,然后立刻投入测试。如果需要五分钟才完成,你可能就会去干别的事,然后再回来看,难免会浪费一些时间 这种效率提升在 Sub-Agent 和并发场景下更加明显。因为它可以更快地产出大量结果,想象一下,如果同时启动一两百个 Sub-Agent,在模型能力没有衰减的前提下,速度提高 10 倍,体验是非常爽的 毕竟这本质上是面向那种对效率有极高要求的 To B 客户所推出的 希望后面大家卷起来,优化一下成本,让普通用户也能放开用这种 UltraSpeed 模型

歸藏(guizang.ai)

26,998 views • 2 months ago

很多人看 Inference Labs , 第一反应都是那些听起来特别硬的技术名词,比如什么 zkML,什么 PoI。 但说真的,如果你把这层技术的皮给剥开,你会发现它讲的根本不是代码,而是权力。 Inference Labs 真正做的,是把 AI 系统里以前那些模糊的权力关系,直接给拆散了摆在台面上。 在传统的 AI 世界里,模型方就是绝对的老大。 模型怎么跑,参数怎么调,最后给你一个结果,你除了相信,没有任何别的办法。 算力方也是一样,谁手里的机器多,谁的声音就大。这种结构下,用户其实是没有任何话语权的。 但 Inference Labs 正在把这套逻辑给彻底拆掉。 在它的 PoI 机制下,模型不再是那个不可挑战的上帝了。模型只能负责干活,负责给出推理结果,但它没有权利定义这个结果是不是对的。 一旦进了这个系统,模型的每一个输出都必须经过证明,经过别人的复现和验证。 这一步,本质上就是在削弱模型的权力。模型不再是权力的中心,它变成了一个纯粹的服务提供者。 再来看看算力。 很多人以为验证网络会让算力变得更值钱,更重要。其实恰恰相反,在 Inference Labs 的结构里,算力其实是被压制的。 算力在这里只负责执行任务,它不负责最后的裁决。你算得再快,机器堆得再多,你也改变不了结果的合法性。你没法靠着算力去强行说服系统接受一个错误的结果。 这意味着,算力在这里变成了一种商品化的成本,而不是一种能让你称王称霸的筹码。 那么,真正的权力流向哪儿了。 答案是验证者。 验证者不需要去训练什么顶级的模型,也不需要去买成千上万张显卡。 他们只做一件事,就是决定哪些推理是被系统承认的现实。这在现在的 AI 圈子里是非常罕见的设计。 它相当于承认了一点,AI 的问题其实不在于它聪不聪明,而在于当它给出结果的时候,谁有资格说这是一次有效的推理。 Inference Labs 把这个资格,从那些模型公司和平台手里,转移到了这个验证层。 这种变化的影响会非常深远。 以后在这个系统里,最强势的一方,不是那些最会训练模型的,也不是那些最有钱堆机器的。 而是那些能长期维持验证信誉的节点。这种节点看重的不是短期的那点博弈速度,而是长期的稳定性。 因为在它的规则里,只要你作恶一次,代价就是被系统永久边缘化。这种代价,任何想长久玩下去的人都承担不起。 所以我也一直在想,为什么 Inference Labs 在短期市场里显得这么安静。 其实道理很简单,这个系统里真正占便宜的角色,从来就不是那些会喊叙事,会搞投机的。 它奖励的是耐心,是持续不断的输出,以及永远不犯错的稳健。它天然地就在排斥那些只想进来薅一把就走的投机者。 我的感觉非常明确,Inference Labs 其实并不是在追求让 AI 变得更强,它是在尝试解决一个更有难度的问题。 那就是当 AI 已经足够强的时候,到底谁来约束它,谁来承担它产生后果后的责任。 在这个系统里,权力第一次不再是围绕着模型集中,而是被彻底拆散,被互相制衡。 这才是它最被低估的地方。 它在重新定义 AI 时代的规则。它告诉我们,在这个新的权力游戏里,诚实和稳定,才是最贵的资产。 #inference_labs #KAITO

比克大魔王

29,048 views • 7 months ago

有个事我憋很久了,今天必须说一下。 市面上那些标榜 AI 驱动交易的 Bot,我深度用过几款之后发现一个特离谱的现象:它们所谓的 AI 就是接了一个 GPT 或者 Claude 的 API,把 K 线数据原封不动丢进去,让一个从来没被训练过理解金融时间序列的通用模型给你输出买卖建议。说难听点,跟拿 ChatGPT 算命没什么区别。 所以 AIX 的多模型路由方案,是我接触这个项目之后第一个真正觉得"方向对了"的设计。 它同时接了 GPT、Claude、DeepSeek R1、Gemini 这些通用模型,也集成了 Kronos 这类专门为金融预测训练的专业模型。中间多了一层调度层,根据当前市场状态智能路由,震荡市用一套推理框架,单边趋势切另一套算法组合。 这个设计的聪明之处在于它承认了一个很朴素的事实:没有一种模型能在所有行情里通吃。趋势跟随在单边市是神,进了震荡就是来回止损。反过来网格在震荡舒服,单边一来直接穿仓。通用大模型做策略意图理解很强但看 K 线的能力确实有限,专用金融模型在时序预测上更精准但没办法理解你用自然语言描述的策略逻辑。没有一个模型能同时搞定所有事。 AIX 干的事不是选一个最强的模型然后迷信它,而是让不同模型在不同环节轮班上岗,动态调权重。这个思路在传统量化里叫多因子动态权重,AIX 把它搬到了 LLM 和时序模型的协同上。 我体验下来的感受是它不像那种一问一答的 Bot,更像有一个小团队在后台协作,你只需要给方向,它自己去协调谁干什么。这个架构如果跑通,抗单一模型失效的能力跟那些只接一个 API 的项目不在一个数量级。 个人分享,非投资建议。

DeFi狙击手 | Ai🕊️

17,513 views • 1 month ago

说个暴论,你的审美和品味就是你的提示词,并决定了你使用AI的上限。 咱们看看这个案例, 零游戏开发经验,两周时间, 一个人,做出了一个完整可玩的3D外卖配送游戏🆒 主角是一只戴粉色头盔的卡皮巴拉, 骑着电动车在城市里穿梭接单, 订单会真实堆叠在后座,掉了就会失败, 还有完整的手机App导航和超市捡货系统, 很多人看完第一反应都是AI太厉害了,但其实并不是是AI的胜利, 本质是人类品味的胜利, 他没写几行代码, 所有的逻辑模型贴图音乐音效, 全都是AI生成的, 他只做了3件事, 1️⃣告诉AI我想要一个卡皮巴拉送外卖的游戏, 2️⃣然后在AI生成的一万个版本里, 3️⃣选出那个看起来最好玩的, 最后花两周时间一点点打磨细节, 调参数摆道具改手感, 其实这就是现在大家说的vibe coding, 让AI接管了所有的执行层, 人类只需要负责方向和品味, 以前你得学会编程建模配乐剪辑, 才能做出一个游戏, 现在你只需要知道, 什么东西是好的, 很多人说这是作弊, 但这才是真正的创意民主化呀, 一年前需要一个小团队干几个月的活, 现在一个普通人两周就能搞定, 我相信未来会有无数这样的作品冒出来,创意会比技术重要一百倍甚至更多。 这也回答了那个很多人都在问的问题, AI时代人类到底还有什么用❓ AI确实能生成一切, 但它不知道的是 什么东西看起来舒服, 什么东西玩起来爽, 什么东西能让人会心一笑, 比如那些纯AI生成的游戏为什么不好玩, 因为它们只有技术,没有灵魂, 那什么是灵魂呢? 我理解灵魂就是那个站在AI背后, 做每一个微小选择的人, 就是那个知道什么时候该停手, 什么时候该再改一下的人, 而且我觉得这只是一个开始, 今天是浏览器3D游戏, 那明天可能就是完整的App, 后天甚至是3A级别的游戏原型, 我们正在见证一个全新的创作时代, 任何人都能把自己的脑洞, 变成真正的产品, 游戏链接放在评论区了, 直接浏览器打开就能玩, 建议大家去试试, 你会真切地感受到, 那个属于普通人的创作黄金时代, 真的已经来了! #AI #游戏开发 #vibecoding

阿绎 AYi

12,095 views • 3 months ago