Loading video...

Video Failed to Load

Go Home

Tibo 发了六个点,我把明天 DevDay 可能发布的东西全连起来了: ① o:常驻型 agent,关掉对话后,它还在帮你干活 ② Ultrafast:回复几乎秒出,开放给更多人 ③ Pro Max:比 Pro 还贵的新方案,传闻 $500/月 ④ GPT-6 Astra:最强模型,降价? ⑤ Managed Agents:开发者写好 agent,OpenAI 帮你跑 至于第六个点…… 和 Jony Ive 合作的硬件?🍩 还是又一个新模型?🤔 毕竟 Opus 5.5 都快骑到脸上了。 如果 OpenAI 憋了这么久,DevDay 最后一个新模型都没有…… 那 Dario 做梦估计都得笑出声 😂

90,492 views • 4 days ago •via X (Twitter)

40 Comments

liuzhihang's profile picture
liuzhihang4 days ago

难道我分析的不对? 不是“新模型发布,速蹬!” 的意思吗? 让大家拉满 6 个点。

Darren's profile picture
Darren4 days ago

有道理,反正 devday 肯定会 reset,加紧蹬 🔥

进诺 JnuoBoy's profile picture
进诺 JnuoBoy4 days ago

Ultrafast 出来后我们的额度会 Ultrafast 地掉么 🙄

Darren's profile picture
Darren4 days ago

会光速的掉 🤣

Vincent Dai's profile picture
Vincent Dai4 days ago

话说是几点开始来着,这回预热了这么久不能大炮打蚊子听个响儿吧👀

Darren's profile picture
Darren4 days ago

北京时间 30 号凌晨 1 点。 我都准备熬夜了,预热了那么多天总不能拉坨大的吧 😂

KoKo's profile picture
KoKo4 days ago

现在最大的问题就是模型不及预期,还有额度给的太少。那不就是说明这个公司没有能力支撑自己的这么大的业务吗?除了欺负用户用不了claude ,还能干什么呢,不如吧算力中心打包给claude算求。到时候国模有卡了,开始爆他菊的时候,有的他难受的时候,一根筋变成两头堵。比a/还/,用astra给你降到4o。

Darren's profile picture
Darren4 days ago

现在确实有点地主家摊子越铺越大,结果余粮越来越少的感觉 😂 模型没拉开差距,额度还抠抠搜搜,再发十个产品也解决不了核心问题 🤡

lunastra's profile picture
lunastra4 days ago

我觉得会直接把 6 Astra 升级成 6.2 Astra 来反超 Opus 5.5 的同时准备迎战 Fable 5.5, 而且会重点优化前端能力,同时发布 6.2 Sol 达到Opus 5.5 的水平并恢复原价,6 Sol 就不管了直接用来打 Sonnet 5.5,如果能实现以上操作就算是 OpenAI 的巨大反击了

Darren's profile picture
Darren4 days ago

然后 A社迅速推出 Opus 5.7,Fable 5.7 反击 打得有来有回才好看哈哈

小姜's profile picture
小姜4 days ago

降价或出新模型,不然堪忧。不过现在两家都用,Claude Code 为了不封号只能远程使用了,还是不如本地 Codex 方便。

Darren's profile picture
Darren4 days ago

感觉 OpenAI 来不及出新模型啊,降价是最快的应对方式了,前提是降价的 Astra 别降智,不然 ChatGPT 真没模型用了,6 sol & luna 根本用不了 🙃

小姜's profile picture
小姜4 days ago

有可能,不然完全没优势了。

TUNA PAY's profile picture
TUNA PAY4 days ago

传闻那个 500 刀的档要是真出来,从 200 刀的 Pro 升上去,一般当天按剩下的天数补一笔差价。 这笔比平时月费大得多,又是境外扣款,卡的单笔限额最容易先卡住。 想第一时间升的,今晚先在银行 app 里看一眼单笔和境外额度。

Darren's profile picture
Darren4 days ago

这个被封号的话,是真的肉疼啊,500美刀

KelvinKMS.com's profile picture
KelvinKMS.com4 days ago

他唯一能做得只剩下加大 5倍用量,還有必須要再出更智能模型,現在的模型完全輸給 Opus 5.5

Darren's profile picture
Darren4 days ago

Tibo 他们好像对 devday 很自信的样子,最好是真的有压箱子模型还没发布,不然真的尴尬了🤣

KelvinKMS.com's profile picture
KelvinKMS.com4 days ago

我已經準備退訂 Codex 了,Claude 太強了,差太多,Codex 還有機率搞壞我的作品,我不敢把我的項目放心交給它了

Darren's profile picture
Darren4 days ago

我目前用下来,感觉 Astra 的 backend 还是比较好一点,所以我都是前端写作用 Opus 5.5,后端用 Astra 而且 ChatGPT 网页版还是很不错的,额度几乎无限还能生图

KelvinKMS.com's profile picture
KelvinKMS.com4 days ago

可是網頁版只有 Sol 5.6 模型可以用而已...

Darren's profile picture
Darren4 days ago

我甚至觉得 Sol 5.6 比 Sol 6 好哈哈

KelvinKMS.com's profile picture
KelvinKMS.com4 days ago

但是我不得不稱讚 ChatGPT 的生圖能力,它生出來的品質是第一名,Claude 這點輸很慘

Panda | AI Agent's profile picture
Panda | AI Agent4 days ago

有新模型,他们早就端出来了无非就是再给你降一点价,再给你多一点福利

Darren's profile picture
Darren4 days ago

别降价了还降智啊哈哈,这样 gpt 就真的一个能用的模型都没有了

Token 丹师's profile picture
Token 丹师4 days ago

你真是神了,比当年悟空脑袋被敲三下都聪明

Haleemah's profile picture
Haleemah4 days ago

Last one is a mystery 😅

Darren's profile picture
Darren4 days ago

That last dot better be worth all this suspense 👀

Haleemah's profile picture
Haleemah4 days ago

I hope it’s a model

Oooooo's profile picture
Oooooo4 days ago

过度分析了啊

Darren's profile picture
Darren4 days ago

有可能 Tibo 只是太无语打了6个点哈哈

Oooooo's profile picture
Oooooo4 days ago

😂

Jhon Dennis's profile picture
Jhon Dennis4 days ago

关掉对话它还在干活 家里杂事就该这样丢 人去追剧

Darren's profile picture
Darren4 days ago

Astra 帮我洗衣煮饭打扫房子谢谢 😎

Steven Chen's profile picture
Steven Chen4 days ago

你好大的胆子,竟敢如此揣测圣意!😬😬😬😬

Darren's profile picture
Darren4 days ago

我是 Tibo 肚子里的蛔虫哈哈

Elio科技迷(互)'s profile picture
Elio科技迷(互)4 days ago

第①条常驻Agent和第⑤条托管Agent要是真能打通,对我们个人开发者来说简直是质的飞跃!以前折腾Agent最头疼的就是长程任务跑一半窗口关了状态全丢,自己搞后台常驻还得折腾服务器部署、心跳保活和沙箱隔离。如果OpenAI官方直接把状态持久化和异步执行给托管了,写好逻辑配置就能扔给云端跑,Agent从玩具走向生产力的一大绊脚石就算被真正搬开了!

warren's profile picture
warren4 days ago

精心制作呀。视频👍

Darren's profile picture
Darren4 days ago

谢谢,你是第一个夸的,开心 😁

Louis Deng's profile picture
Louis Deng4 days ago

reset 6 次

Paul Zhu's profile picture
Paul Zhu4 days ago

不出一个能打的sol模型,这波真的被op5.5清场了

Related Videos

最近当大家都在刷屏Fable 5和GPT-5.6 的时候, 殊不知腾讯已经悄无声息的把大模型能力给追上来了。 你们知道腾讯低调到什么程度吗? 前几天发布的Hy3 ,21B的激活参数已经可以打平旗舰水准,并且直接塞进微信10 亿+用户手里 , 这才是国产大模型真正的王炸啊兄弟们! 说实话周一刷到 Hy3 发布消息那会儿, 我第一反应跟很多人一样:又一个卷参数的国产模型? 趁着周末有空,我仔细翻了一圈资料, 发现完全不是这么回事。 原来Tencent Hy这个模型从一开始就不是朝着聊天模型去的,人家的定位就是奔着干活去的 Agent 向 LLM。 另外最反直觉的是它的推理效率,295B 总参数, 实际激活只有 21B 的 MoE 架构, 就能打平参数是它 2 到 5 倍的旗舰模型, 这事儿我琢磨了一下,其实有点像团队管理, 并不是说人越多产出越高, 关键得看真正干活的那几个人靠不靠谱。 为什么这个效率重要呢? 你想想微信每天服务 10 亿人, token 成本多一厘都是天文数字, 21B 激活还能打出旗舰水准, 我觉得这才是它能被规模化铺开的根本原因, 跟刷榜没半毛钱关系。 说到刷榜,我仔细研究之后这个版本还真不是, 从 preview 到正式版,Hy3 是Hunyuan团队拿了50 多个真实业务的反馈不断迭代出来的,内部 WorkBuddy 任务成功率从 72% 干到 90%,耗时降了 34%,幻觉和常识错误全往下掉。 我原来以为 Agent 的核心是想得多深, 后来发现真正决定能不能上生产的,是稳不稳, 比如工具编排会不会中途崩,出错了能不能自己爬回来,换个框架差不差太多等等, 就是这些不起眼的东西, 才是能跑完一整套 workflow 不掉链子的关键。 当然实际测试下来Hy3 也有短板, 比如纯视觉它还不够强,不过腾讯也有单独的多模态大模型线,它能打的主要还是 coding、办公、复杂任务规划这几块。 最后说个我的一个判断:就是接下来大模型拼的可能不是谁参数更大了,核心看谁能把干活的能力以最低摩擦送到更多人手里,比如Hy3 我理解它可能不是一个更会聊天的模型,更像是一个更会干活的 Agent 底座。 话说回来,腾讯这步棋确实走得挺狠, 我觉得国产大模型的拐点真的要到了, 下方视频是我用Hy3跑的几个测试案例, 分别让它做了一个介绍自己的HTML网页, 一个我的认知系统agent网页, 和做了一个10页的PPT,都很惊艳,大家可以感受下, 会干活、会自检、还会主动说自己哪没做到位, 我觉得这才是 Agent 时代,真正能用的模型该有的样子hh~ #Hy3 #Hunyuan #TencentAI

AYi

194,696 views • 2 months ago

Qwen3.8-Flash-Next 开源了,Qwen4 的架构预览被扔出来了。 现在很多模型,底座没怎么变,做一层后训练之后,Agent 能力能突然往上窜一大截。 那问题来了: 后训练到底训练进去了什么? 是知识更多了?推理更强了?还是模型“干活的方式”变了? 我正好部署了两个特别适合做 A/B Test 的模型: 🔥Apodex-1.1-mini-GPTQ-Int4 vs 它自己的底座 Qwen3.5-35B-A3B-GPTQ-Int4 但做完后训练以后,Apodex 自己公布的 benchmark 已经吹得挺狠了: 在 FrontierFinance 上,Apodex-1.1-mini + Agent Team 拿到 50.2。 同一个 benchmark 里,Claude Fable 5 的参考成绩是 49.2。 一个 35B 的开源模型,后训练一下,号称专业 Agent 能力已经能摸到甚至超过 Fable。 这个我偏不信。 我正好有机器。我有两张 4090。 一张跑 Apodex,一张跑原版 Qwen。 同架构、同 INT4、同 128K 上下文、同一套 Agent Harness,两边同时接完全一样的任务。 所以这个实验非常干净: 底座基本没变,主要看的就是后训练到底给 Agent 加了什么能力。 结果越来越有意思。 甚至测出来一层能力,已经开始往 Fable 那个方向靠了。 🔥我给这两个模型和 Fable 出了一道预测题。 2026 年 8 月 26 日,NVIDIA 当天盘后要发 FY2027 Q2 财报。 我提前几个小时,让它们预测: 总营收 GAAP 毛利率 Data Center 营收 下一季度指引 要求自己上网调研,最后给判断。 本来我只是想看看:同一个底座,做过后训练以后,Research + Agent 能力到底能提升多少。 🔥结果这道题出了个非常离谱的乌龙。 底座其实非常努力。它搜了 40 次。 而且最离谱的是:它中间已经把正确答案全部查出来了。 然后到了最终答案——它自己把这些正确数据全扔了。 我一开始都看懵了。 后来翻完整 Agent 日志,才发现真正有意思的事情: 当外部证据和模型脑子里的旧认知发生冲突时,它到底信谁。 🔥这时候你就能明显感觉到,后训练之后的模型,跟底座已经不是一个“工作状态”了。 它看起来会更聪明、更机灵。 它更像一个被教过怎么干活的人。知道什么时候该搜。知道哪些证据更重要。 以后每个企业,都会有一个自己的模型。 不一定是从零预训练。 但至少会有自己的后训练、自己的 Agent 行为、自己的工作习惯。 🔥小模型不一定非得和 Frontier Model 拼所有能力。 把一个方向训透,再配上一套好的 Harness 和 Tool Use,它真的可以变得非常机灵、非常能干。 最后夸一下 Apodex。 这次不只是模型后训练做得好,他们那套 Harness + Tool Use 也确实很能打。 一个 35B 模型被他们训完,再塞进这套 Harness 里,真的已经开始有点专业工种的味道了。

实践哥 Li

66,035 views • 1 month ago