Loading video...

Video Failed to Load

Go Home

LLM 的速度,有两种体验:等多久开始回答,回答时是否流畅。 两种体验,与 Prefill 和 Decode 密切相关。 从发出请求到收到第一个 token,这段等待叫 TTFT,首 token 反应时间。 模型在其中进行 prefill,处理输入内容 开始回答后,模型通过 decode 逐步生成后续 token,相邻两个 token 到达的间隔叫 ITL,token间延迟。 TTFT 越短,反应越快;ITL 越短且越稳定,回答就越流畅。

11,768 views • 18 days ago •via X (Twitter)

0 Comments

No comments available

Comments from the original post will appear here

Related Videos

MiMo推出1000 Token/s超高速模型|体验测评 MiMo 推出了 MiMo V2.5 Pro UltraSpeed 超高速的模型版本,能够实现每秒输出超过 1,000 Token 的速度。 同时,这应该也是全球第一个达到这个速度的万亿(1T)参数模型。 藏师傅提前试了一下,做了三个测试,确实爽。 第一个跑了一个比较复杂的 3D 采矿小游戏测试。在没有素材的情况下,我让它全部用 Three.js 前端代码来生成素材。整体要求比较完整,虽然第一次实践时出了一些小问题,但在跟他沟通修改建议后,非常完美地实现了任务。 这次测试的各项指标如下:思考的 TPS:804 Token/s,峰值速度:810 Token/s,首次响应时间:4.71 秒。 第二个测试给了一个官网,其头部包含一个相对复杂的 3D 动画。 这次的输出速度快了非常多:峰值达到了 1426 Token/s,首次响应只用了 0.83 秒,在 32 秒内输出了 25624 个 Token,总计生成了 1000 行代码。 第三个测试给了一个更复杂的官网。我要求这个官网的 Header 头部包含以下 3D 效果:地球边缘、轨道上的飞船、星际尘埃、航线图、舷窗的 HUD 样式。 这个效果非常好,整体的视觉样式、状态、SVG 动画和驾驶卡片都非常精细,还有滚动的视差效果 这个输出的 TPS 达到了 1136 tokens/s,首次响应是 4.5 秒 官方测试平台下面有个数据展示,会显示相关信息 在流式输出的情况下,当你看着它只用 20 秒就产生一个非常复杂的 3D 游戏时,那种场景还是比较震撼的 之前的这些(比如说 Groq 之类的)超高速推理方案,在模型能力或者是整体水平上都会有所下降,但是 MiMo 这个在测试的时候,我没有看到这种迹象 最近很多公司都开始推出这种超高速的 API 服务,比如之前 OpenAI 和 Anthropic 都有 Fast 模式 在 Agent 场景下,模型输出效率的提升会直接带动每一步 Agent 操作的效率: 如果一个任务预估一分钟完成,你就会盯着它直到结束,然后立刻投入测试。如果需要五分钟才完成,你可能就会去干别的事,然后再回来看,难免会浪费一些时间 这种效率提升在 Sub-Agent 和并发场景下更加明显。因为它可以更快地产出大量结果,想象一下,如果同时启动一两百个 Sub-Agent,在模型能力没有衰减的前提下,速度提高 10 倍,体验是非常爽的 毕竟这本质上是面向那种对效率有极高要求的 To B 客户所推出的 希望后面大家卷起来,优化一下成本,让普通用户也能放开用这种 UltraSpeed 模型

歸藏(guizang.ai)

27,376 views • 3 months ago

非常Nice啊,这模型完全免费,Token终于可以自由白嫖了,甚至视频模型都是免费的,太爽了。 它叫Agnes AI,全球模型榜前十,6 月 1 号起把自己家三个核心模型全免费开放了,无限期。图片模型在 artificial analysis 上榜了,文字模型一周被干了一万亿 Token。我把它接进 Claude Code,配起来十分钟的事,Token 随便用。 这玩意到底是什么呢。 Agnes AI 是全球模型榜单前十的一个 AI Lab,这次免费开放的是三个模型,文本、图片、视频。 文本模型叫 agnes-2.0-flash。能写代码,能做知识问答,能跑 Agent,能规划复杂任务。在 Claw-Eval 智能体评测榜进了 Top 10。说真的,这周它还要上 1M 超长上下文,以前用 200K 的模型跑到 150K 就降智,这种破事不用再忍了。 图片模型叫 agnes-image-2.1-flash。图改图、多图融合、换背景、改文字、图像修复,电商主图和广告素材这种反复改的场景,太合适了。最近还加了 4K 超高清输出,最高 4096×4096,生成的图可以直接进印刷,不是那种看着还行一放大就糊的草稿。 视频模型叫 agnes-video-2.0。原生音画同步,首帧生视频、首尾帧生视频、多镜头切换都支持,720P 和 1080P 随便选。 接进 Claude Code 怎么搞,其实很简单。 第一步,去 注册,拿到 API key。 第二步,打开 cc-switch。右上角选 Claude CLI,右上角点 + 号,选自定义配置。把 API key 填进去,请求地址写 格式选 OpenAI Chat Completions。 第三步,点获取模型列表,选 agnes-2.0-flash。 第四步,点左上角设置,找到路由,打开路由总开关,Claude 打开。 完事。 回到 Claude Code 正常发消息,模型就已经切过去了。我试了一个在酒吧吉他弹唱的视频,和真人区别不大。 现在 Token 不要钱,Agent 该跑几轮跑几轮,该拆几步拆几步。反正我觉得这才是免费开放最爽的部分,不只是省钱,是心理上解放了。 我测试了一下视频模型,能用,就是慢了点,文字模型还是比较快的。 开发者文档在 OpenClaw、Hermes、Claude Desktop 的,也有现成教程。

产品经理老王霸

55,427 views • 3 months ago

刚去小米店摸了下它的折叠机有感,大家有没有注意到在安卓这边折叠机都叫“Fold”,而苹果选了“Duo”。 其实从字面意思来看,Fold就是折叠,强调这个动作,很直观,但苹果使用了Duo这个从拉丁语来的词,它其实是有一组,一对的意思,是个组合。重点从“能折”转到“两种体验(一个手机两个形态,手机+iPad)是一对、能一起用合二为一,强调的是体验。 现在在回过头来看苹果的那个折叠动画,就解释了这个Duo,它从手机形态打开到iPad形态,或者反过来闭合起来,动画是连续的,强调只是变了形态,从人的大脑认知来看也是一样,你看到的东西没有消失后又出现一次。并没有安卓那样,从一个形态关闭后,又重新打开了另一个形态,中间过程不连续,是断开的。所有安卓折叠机都是这样,你在外屏打开一个app,在展开的时候,内屏是从黑到重新打开app的一个过程。所以并不能简单理解苹果的和其它安卓在这方面,就是多做了个过场动画那么表面。 另外苹果在这个时候推出Duo,一个呢,当然也是供应链技术发展到了苹果认为相对成熟的时候,二呢,也是它的AI布局,目前Apple Intelligence在今年也会迎来大更新,苹果相信在手机+iPad这个二合一的组合形态下,人们可以更好的体验AI的各种操作。简单的任务可以在手机形态下进行,复杂点的比如Codex和Claude这样的编程任务,也方便在iPad这个形态下进行。 如果说安卓或者是更早的微软Surface Duo开启了折叠这个形态,那么Apple可以说是重新定义了它。后续发展会更有意思,感谢自己处在这个科技飞速发展的时代,可以亲自见证这些迭代的过程。 当然我个人现在并不会买第一代的Duo,毕竟它相机过于拉胯了,这个是我个人非常看重的一个工具。 大家Enjoy!😊

小鹏Digital

28,951 views • 19 days ago

TermMax TermMax | Fixed Rate Borrowing & Lending 里其实走着两只钟。 一只从你把钱打进去就开始转,记录资金有没有在干活。另一只要等订单真正按条件匹配上,才开始锁固定利率。 我最近看了下官方 USDC/ynRWAX 这个市场,到期日是 2026 年 6 月 30 日,你可以挂 8% 的目标 APY,还没成交时,界面显示大概 4.49% 的浮动 APY,同时 LEND APR 在 7.43% 左右。 很多人第一反应就是到底我最后拿哪个利率? 其实它们说的是不同时间段。 钱一进去,第一只钟就动起来了。等待成交的这段时间,资金不会完全闲着,通过底层机制还能继续赚浮动收益。无论最后匹配到多少,这段资本至少没白放。 第二只钟要晚一点启动。只有订单按照你设定的目标条件被接走,固定利率才真正锁住,从那刻起一直算到到期日。 整个路径就是:存入资金 → 先跑浮动等待 → 订单匹配成功 → 固定利率生效 → 持有到期。 这套设计比传统固定利率产品聪明的地方在于,订单挂着等对手的时候,资金还能产生收入。相当于给排队资金装了个小发动机,不会完全停摆。 对用户来说,屏幕上那个 8% 是你愿意成交的价格,不是已经到手的数字。什么时候能从浮动转成固定,得看订单簿深度和市场实际报价。 这就带来一个实际问题,你已经看到 8% 了,但不知道要等多久才能真正锁定它。 对短期资金,这段时间差会直接影响最终收益。对有明确还款或付款计划的人,甚至会打乱整份现金流安排。 目前 TermMax 已经解决了等待期资金闲置的问题,下一步如果能多展示类似报价的历史平均等待时间、不同目标 APY 区间的成交概率,用户对整个过程的预期就会更清楚。 现在公开信息还不足以直接把 8% 当成确定到手收益,也没必要把等待期说成产品没用。更真实的情况是资金已经在工作了,只是完全确定的那段还没开始。 你更在意等待期间每一分钱都在转,还是希望从存入第一秒起,整段收益就完全锁定?

Domingo_gou | ASHVA🐴| OP_CAT| 🐬TermMax

16,553 views • 3 months ago

命运喜欢反复考同一道题,直到你答对为止。 如果同一件事反复砸到你,很可能不是你运气差,是你没有做出正确的选择。 最近市场这么乱,比特币又跌得大家心慌,我看到 TermMax | Fixed Rate Borrowing & Lending 的Dual Investment Vault,突然就懂了点东西。 很多Diamond Hands其实一直在犯同一个错,他们学会了死扛,却没学会真正等。扛和等看起来差不多,其实天差地别。 我见过太多人,从怀疑到相信,从恐慌到坚定,一路从熊市扛到牛市,最后确实赚到了涨幅。可回头一看,他们赚的是价格上涨,却从来没让等待本身生钱。比如拿NVDAon的兄弟,从100扛到150赚50%,大家只看到那50%,很少人会想,从100到150的这段等待时间到底值多少钱。 市场以前给不了答案,因为等待没标价。直到Dual Vault出来,我才觉得这玩意儿真不一样。它最牛的地方不是APY有多高,而是第一次让等待也能直接变现金流。 简单说,如果你存代币进去,到期价格低于行权价,你就拿回原代币外加一份premium;如果高于,你就拿稳定币外加premium。存USDT的话逻辑反过来。 很多人第一反应是问收益高不高,但我觉得关键根本不是收益数字,而是你最后愿意拿回什么资产。你存了啥、选了啥行权价,其实就是在选你接受的未来。 整个过程里,市场里的交易者在付premium买方向敞口,而存Vault的人就站在对面收这份钱。现在支持NVDAon、SPYon、QQQon、CRCLon这些Ondo代币化资产,全在BNB Chain上跑,固定费用、到期日清楚,没追加保证金也没清算风险。 所以Dual Vault卖的可能不是单纯收益,而是一种交换:交易者买波动,Diamond Hands卖时间。以前Diamond Hands靠信仰撑着,现在他们开始领工资了。 当然代价还是有。如果NVDAon大涨突破行权价,你可能拿回稳定币加premium,错过后面继续涨。很多人觉得这是风险,其实更像是机会成本,后悔才是最大的代价。价格涨了你会不会后悔换早了?价格跌了你会不会庆幸提前收了premium?每个人答案不一样,这也正是它有意思的地方。 我一直觉得,市场里最贵的东西不是价格,而是时间。价格天天变,时间一去不回。以前的Diamond Hands赚上涨,现在有人试着给等待定价。Dual Vault没改资产价格,它只是让大家第一次意识到,等待本身也能变成一种资产。 时间会给出答案,市场总会奖赏那些真正懂时间价值的人。

Domingo_gou | ASHVA🐴| 火币赚币| OP_CAT| 🐬TermMax

20,539 views • 3 months ago

我想,每个小伙伴心中应该都有一个 「要是有人能帮我把这个工具做出来就好了」 的念头吧? 但不会写代码,有想法也使不上劲 这两年 AI 一波接一波——从文本对话到 MJ/SD 出图,再到 Sora 级别的视频生成,再到能写代码的顶级模型。确实帮很多人省了时间,也圆了不少「小小梦想」 昨天 Claude Fable 5 正式发布了。小红书、B 站、抖音上全是测评。 嗯……小九只想说一句:贵得一B —- $50 一百万输出 token,跑几个任务可能就要几美元 不过还好,找到了一个叫 ZenMux 的中转平台,第一时间接入了 Fable 5 的官方 API 于是我用 Fable 5 和 Gemini 3.1 Pro Preview 做了一个前端 UI 生成对比 同一个提示词,看看两位顶级选手表现如何 👇 1⃣响应速度 Gemini 3.1 Pro 耗时64s 输出量:7,674 tokens Claude Fable 5 耗时214s 输出量:22,156 tokens 一开始被 Gemini 的速度吓到了,64 秒就出完了? 但仔细一看……好家伙,Gemini 偷懒了 😅 输出只有 7,674 token,明显是简化了方案 反观 Fable 5,虽然慢了 3 倍,但输出了 22,156 token,几乎是 Gemini 的 3 倍。 每项功能都写得扎扎实实,代码完整度明显更高。 2⃣速度换算: / Fable 5:103.5 tok/s(扎实输出,不偷懒) / Gemini:119.9 tok/s(快是快,但省了不少细节) 所以那句话确实没骗人——任务越长越复杂,Fable 5 优势越明显。 3⃣燃烧的 token(费用): 1/ 输入: Fable 5:3,059 Tokens Gemini 3.1 Pro Preview:1,671 Tokens 2/输出: Fable 5:22,156 Tokens Gemini 3.1 Pro Preview:7,674 Tokens 3/ 费用对比: Fable 5:约 $1.14 Gemini 3.1 Pro Preview:约 $0.10 在输出量约为 2.9 倍的情况下,Fable 5 的成本约为 Gemini 3.1 Pro Preview 的 11.4 倍 但贵有贵的道理——活更细、代码更完整、几乎没有偷工减料。 不过如果你只是想要一个快速原型,Gemini 的性价比确实香。 —- 小结一下: Fable 5:适合复杂项目、长任务、追求完成度的场景。强,但贵。 Gemini 3.1 Pro:适合快速出活、轻量原型。便宜又快,但质量上限不如 Fable 5。 ZenMux 作为中转平台,这次体验下来还不错: ✅ 第一时间接入了官方 API ✅ 一个平台切 200+ 模型,对比很方便 ✅ 不限 RPM,连续测了十几次没断过 ✅ 现在有限时返赠,充 20送10 / 充 50送30 想自己测 Fable 5 的,可以趁这周活动试试 官方入口: 两个UI界面展示(1是Fable 5,2是gemini)

车九

27,552 views • 3 months ago

《精通 Pendle 系列》 之〝早买YT是否有优势❓” ❓“如果以同样多的入场本金、买入的YT利率相同,那是不是无论任何时间入场,最终到期挖到的积分是否一样多?” 看答案之前,先想想一分钟吧 … … 这系列是给已经懂YT原理、已经有一些操作YT经验的 不然,最好还是先看Pendle网站教育专区的「新手入门」 回来看答案 首先,理论上,的确是:“在不考虑滑价和费用之下,并假设任何时候挖的积分权益都一样的前提下”,那么,“同一个入场金额、同一个入场的implied APY利率、最终挖到到期的积分/收益是一样的” 这是因为随著时间越接近到期日,YT 有效杠杆会一直上升:在同一个implied APY之下,一个月前100元可能买到2000个YT,今天可能就买到5000个了。时间虽然少了,但YT数量上升,刚好互相抵消 (同一个implied利率之下) 那是不是 早买YT还是迟买YT 都完全一样? 那又不然 你回看我上面那段文字,里面已经有好几个假设了… 早买YT的*可能*优势包括: 1️⃣空投或快照可能早于到期日发生 2️⃣一些项目可能给早期用户或给早期YT更多bonus,例如更高的积分乘数(如之前Resolv、或最近的Terminal的池子) 3️⃣末期的池子通常滑价很大(因为末日期权效应、杠杆上千倍) 4️⃣有些池子设有TVL上限,迟来者未必能买到 5️⃣过去经验通常较多人冲头矿挖LP时池子的利率比较倾向下跌 迟买YT的*可能*优势: 1️⃣ 较后期你对项目的表现、估值、是否有延迟TGE倾向等有更多了解 2️⃣ 较后期你对项目的积分通胀(参与人数/总积分是否太高)有更多了解 3️⃣ 较后期你对市场的定价也较好的理解 4️⃣ 越迟入场、越能避免遇上活动期间市况由牛转熊 5️⃣.YT后期有越来越高的杠杆效果,虽然同一本金同一利率的最终效果一样,但杠杆较高时,容许你比早期參與者以更小的本金参与,就像买彩票的效果 其他考虑因素: * 不同时间因为池子的流动性、或Pendle的收费水平也可能不同,影响买卖成本 暂时写到这里 大家有想法的话,也可以补充或发问~ Pendle Intern Pendle TN | PendleBoros Yoko | Pendle RightSide 🙏

3lbn3qrekoj

21,623 views • 1 year ago

🔥 MemeMax,正在完成从“内容热点”到“长期坐标”的转变 很多项目的生命周期很短,是因为它们只能在某个情绪窗口里成立。而 MemeMax 不一样,它正在脱离单一情绪的依赖,逐渐变成一个可以被长期使用、反复回访的存在。 你会注意到,它的节奏非常克制。没有强行制造高潮,也不急着证明自己“很大”。内容持续输出,但不疲劳;讨论不断发生,却不空转。meme 提供足够的传播张力,AI 保证效率与密度,两者形成了一种稳定且可复制的模式。 这种模式带来的直接结果,是参与门槛被不断拉低。你不需要等热点,也不需要理解复杂背景,只要进入,就能自然参与。久而久之,MemeMax 不再是“要不要试试”的对象,而是顺手就会点开的存在。 更重要的是,项目的信用正在通过行为而不是承诺建立。更新没有中断,互动有反馈,节奏有延续性。参与者开始形成心理预期:它会继续运转,它不会突然消失。这种预期一旦稳固,外部变量反而成了加速器。 市场真正放大的,往往不是最吵的项目,而是那些已经把结构搭好、只差情绪的系统。MemeMax 正在这个阶段,把时间变成自己的筹码。 等到注意力重新集中时,很多人会发现,它早就站在那儿了。 参与入口👇 👉 #MemeMax MemeMax Kaito AI 🌊

小宝| TermMax⚡️.🕊️

23,503 views • 8 months ago

Kimi要去香港上市了,一次发布同时完成了三件事:产品更新、市场重定价、IPO 预路演,喵的真是一场伟大的操盘!!! K3发布前脚刚砸跌纳斯达克1%,然后转头Kimi就启动港股IPO筹备,一场发布干了几个亿路演的活,真特么牛逼,背后有高人哈哈,来一起回顾这场牛逼的操盘吧: 7 月 17 日凌晨,月之暗面发了 Kimi K3,2.8 万亿参数,Arena 前端代码排名第一,即将开源。 然后 24 小时内发生了两件事, 第一件,华尔街半导体股开盘重挫,纳斯达克跌了 1%,标普 500 跌了 1%,CNN 和彭博社的报道标题里,中国 AI 模型冲击美股是关键词。 第二件,《投资界》报道说 Kimi 已通知投资者调整公司架构,筹备赴港 IPO,最快 6 个月内完成港股上市。 别人的股价在跌,自己的股价准备开始。 这两件事放在一起,是不是比 2.8 万亿参数精彩多了, 一个中国开源模型的 Arena 排名,能直接变成纳斯达克 1% 的跌幅,不是因为 K3 全面超越了谁,它在综合智能指数上排第四,Fable 5 在 35 项评估里赢了 22 项,并不是新王者。 那华尔街在怕什么呢? 我觉得怕的不是这个模型本身,他们怕的其实是前沿能力 + 开放权重 + 中国公司这个组合,对闭源 AI 万亿美元资本支出的那个底层假设,突然给了一个反面例证。 那个假设很简单:最先进的 AI 能力是稀缺的,稀缺就应该贵,贵就需要巨额资本支出,巨额资本支出会带来长期的定价权。 K3 在这个假设上钻了一个空子, Arena 前端人类盲测第一,输入 $3,输出 $15,Fable 5 的输出是 $50,权重 7 月 27 日开放,之后任何人可以自己部署、微调、塞进私有工作流。 如果,注意是如果啊兄弟们,$15 的输出价格就能拿到人类盲测投票第一的前端 coding 能力,而且权重马上开源,那花几千亿美元训练闭源模型、然后收 $50 输出费用的商业模式,是在修一条收费高速公路,还是在一座即将免费的桥旁边建收费站。 华尔街的反应不是说这个模型太强了,是担心这个定价让整个投资回报率的算术变得不好看了。 这是第一层,第二层更有意思, Kimi 通知投资者调整架构,启动赴港 IPO,从短期不着急上市到筹备港股上市,不到一年。 这个时间窗口的选择显然不是偶然, Arena 前端第一 + 华尔街震动 + CNN/彭博头版,这套组合给了 Moonshot 一个全球定价时刻,在它走向公开市场之前,让全世界的投资者都知道了它的名字,而且不是在中国 AI 追赶者的叙事里,是在能让纳斯达克跌 1% 的叙事里。 IPO 需要的是一个让承销商可以讲的故事,K3 在 24 小时内把这个故事递到了全球财经媒体的头版上。 别人花几个亿做路演,Moonshot 用一次模型发布就做到了。 以前 AI 模型发布的受众是开发者和从业者,现在它的受众包括华尔街交易员、半导体分析师和港股承销商。 AI 模型发布正在从技术事件变成宏观事件。 这个转变一旦成立,以后每一家前沿 AI 公司的新模型发布,都不会只是开发者社区的节日,它会像上市公司的财报,不只是我们做到了什么,更是这个做到的事,让谁的假设失效了。 K3 不是第一个触发这个转变的模型,但它是第一个让发布即冲击这个范式变得如此清晰可见的。 一个中国公司,把开源模型的 Arena 排名推到前端第一,然后让大洋彼岸的半导体股跌了 1%,再趁势启动自己的 IPO 筹备,感觉有点像在上演一场关于定价权的公开争夺🤔。。。。 而争夺定价权最好的方式通常不是发论文,最好的方式就是让你的产品发布,直接变成别人股价的变量。

AYi

89,164 views • 2 months ago

Claude有个很让人不爽的点!! 每次新模型发布,官方非订阅用户连体验的资格都没有!! 想起之前在 ZenMux 充了钱还没用完,登上去一看,没想到已经上架了Claude Fable 5 , 也算是第一时间体验上了这个“目前最强模型”。 听说这模型死贵!! 于是很慎重的用它跑了一个支付模块重构的任务! 零代码基础,只能把之前Codex的输出给复制进去, 任务要求比较复杂: 保持原 API 兼容; 拆出 PaymentRequested / PaymentSucceeded / PaymentFailed; 补幂等,避免重复扣款; 改状态机; 更新单测; 输出迁移风险; Fable 5 不算快,面对这个长任务,它做对了两件事: 第一,先拆计划,再执行。 它把兼容层、事件定义、状态机、handler、测试、回滚风险都列出来了。 第二,最后主动自检。 它自己指出:支付成功事件必须幂等;旧接口“返回成功”不再等于“扣款完成”,调用方文档要改。 结果看起来,还是一如既往的稳! 但是真的贵,就这么几分钟,直接跑了十多美金!! 所以,我觉得要是家里没有矿,还是不要随便用Fable 5 ,根本不适合当常驻模型! 感谢Zenmux让我体验了一下“宇宙最强”! 虽然有点贵,但有时候相比价格,省心省力会更重要。 比如多文件重构、复杂迁移、PR review、长链路 Agent workflow这些复杂任务,偶尔用用,还是可以的! 最后说一下 Zenmux,它有个PK 模式我一直很喜欢,可以同屏对比多个模型输出、延迟和成本。 现在刚好还有个限时的充值返赠活动: 充 20 美元送 10 美元 充 50 美元送 30 美元 如果你想第一时间体验Claude Fable 5或者其他模型,现在就是下手的最好时间!

沐阳

15,442 views • 3 months ago