Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

离谱,FUMO 这个模型,在我这几轮复杂任务里居然比 Fable 5.1 和 GPT-5.6 Sol 更好用,价格也便宜老多了!!! 他是一个融合模型,设计非常精妙,而且完全可以应用到生产级,你可以把它理解成他会根据任务做到哪一步,临时找最合适的模型参与,最后给你最好的结果。 这和我之前用过的融合模型差别特别大,以前很多产品都是几个模型同时回答,再把答案拼到一起,但是效果挺鸡肋的... FUMO 在任务执行中动态调度,它每完成一步,再决定下一步该让谁做什么,并且能够选择最适合的模型。 我做了很多测试,它在复杂任务上的表现完全不输顶级旗舰,价格却便宜了一大截。 我给 FUMO 上了几种完全不同的难题: 跨多个系统找故障、判断容易被常识误导的科学问题、从一堆冲突资料里做商业决定,还故意在中途加入新证据。 它有时继续查,有时否定前面的结论,有时停下来补证据,最后都能给出一份完整结果。 这个才让我觉得 FUMO 牛逼:任务怎么变,它都知道下一步还该做什么,而且价格比旗舰模型便宜很多。 很多任务都很适合直接上 Fusion: 1、一个问题横跨很多文件和系统 2、商业方案、几十份资料互相冲突,需要做深度调研 3、Agent 连续执行很多步,中间结果会污染后续步骤 其实简单问题大多数模型都行,但任务越复杂、出错后的代价越高, FUMO 的优势越明显,它目前还是邀请制,期待全量开放!

16,530 Aufrufe • vor 1 Monat •via X (Twitter)

24 Kommentare

Profilbild von 阿链
阿链vor 1 Monat

关键不是又便宜又强,是它肯否定自己前面的结论。任务中途一变,很多旗舰还在硬圆,它知道该停、该查、该改口。复杂活最贵的从来不是token,是中间一步走歪,后面整条链一起废。

Profilbild von 木向
木向vor 1 Monat

FUMO 在复杂任务上表现比 Fable 5.1 和 GPT-5.6 Sol 更好真给我惊讶到了

Profilbild von Feng
Fengvor 1 Monat

FUMO 任务怎么变,它都知道下一步还该做什么,我的个乖乖,太智能了吧!现在还是邀请制,必须尝个鲜!

Profilbild von asashiki
asashikivor 1 Monat

@grok 这不是我们 sakana~ 的活吗? 和 sakana 比怎么样?

Profilbild von 锦鲤
锦鲤vor 1 Monat

FUMO这模型就像职场老油条,懂得看人下菜碟还带随时纠错,打工人看了直呼内行!😂

Profilbild von Jason傑森 🇭🇰 | 🛠️
Jason傑森 🇭🇰 | 🛠️vor 1 Monat

价格碾压

Profilbild von 我也笑了
我也笑了vor 1 Monat

第一次听说融合模型,期待开放过后试试

Profilbild von ivan zheng
ivan zhengvor 1 Monat

性价比高,挺好用

Profilbild von 泰莎 Tessa Ralen
泰莎 Tessa Ralenvor 1 Monat

FUMO融合模型真的比Fable 5.1 和 GPT-5.6 Sol 更好用吗?期待全量开放

Profilbild von Crio Songo
Crio Songovor 1 Monat

这种动态调度的设计思路确实比简单拼接合理多了,正好最近项目要降本,我这就去测试下效果。

Profilbild von Brown
Brownvor 1 Monat

融合又便宜怎么做到的,缓存命中不高吧

Profilbild von 懒家伙
懒家伙vor 1 Monat

在适合的地方,用最适合的模型,这是将来的趋势。

Profilbild von 硅谷AI玩家
硅谷AI玩家vor 1 Monat

这动态调度也太会玩了,走一步再决定下一步让谁上,比那种几个模型一起答再拼答案要强一些~

Profilbild von Connor_AI
Connor_AIvor 1 Monat

感觉这种模型有很多步数,那会不会非常慢?

Profilbild von E吴大哥wu|
E吴大哥wu|vor 1 Monat

FUMO这种按需执行的方式才是真正的项目管理

Profilbild von 叫我阿杭
叫我阿杭vor 1 Monat

离谱,咋还有个融合模型?我都没听说过这东西

Profilbild von 余温
余温vor 1 Monat

好用又便宜,就是有点慢

Profilbild von Steven蒙
Steven蒙vor 1 Monat

主流的模型太贵了,一直在找些平替的模型,感觉自身的需求也不是很高,这个有商业模式的模型可以尝试下

Profilbild von 王二狗
王二狗vor 1 Monat

这种又便宜又好用的模型,真的太香了!

Profilbild von 余温
余温vor 1 Monat

价格很香

Profilbild von 阿熊学AI
阿熊学AIvor 1 Monat

我更在意的不是便宜,而是它会在新证据出现后停下来改口。复杂任务里,能纠错比一路自信地跑完更值钱。

Profilbild von 晨星繁70 BG
晨星繁70 BGvor 1 Monat

真的假的 这省钱神器啊

Profilbild von 知不道吧
知不道吧vor 1 Monat

平常做项目特别难的任务就没有多少,没必要每一步都用最贵的模型。FUMO 这个按任务进度换模型的思路挺有意思,根据不同的任务调用不同的模型,既能充分利用模型和还是节省大量的token

Profilbild von 魔王w3👿
魔王w3👿vor 1 Monat

一步步换模型,比把答案硬拼一块靠谱

Ähnliche Videos

卧槽,最近发现一个强的有点离谱的 AI 团队。 96人的团队约 2/3 的研发成员是在校学生,博士、硕士、本科生都有,来自复旦、中科院软件所、中科院自动化所、人大、哈工大、华东师大等高校。 本来以为又是什么学生创业项目,结果顺着他们做的东西看下去,发现不太对劲。 他们做了一个 Agent 模型,叫 Atria Dawn Preview Atria ASI。 官网放出来的 Demo 一个比一个猛。 有科研和深度研究,有完整的软件项目,有交互作品和游戏,还有 3D 建模、CAD 机械结构。 重点不是让模型生成一张图或者一段代码。 而是让模型在一个真实环境里持续推进任务。 Atria Dawn Preview 面向科研、开发和专业工作,可以往下推进资料检索、写代码、调用工具、运行实验,再根据真实结果继续修改。 代码能不能跑,文件有没有生成,结果是否符合要求,也可以通过外部工具和环境继续验证。 看了一圈,我也拿了用它跑了个任务,因为之前9 月 12 日是世界急救日。 我就让它做一个 3D 海姆立克急救法互动学习页面。 就用大白话描述需求后,它开始拆任务、写代码、搭 3D 场景、做交互,再根据运行结果继续修改。 最后就是视频里的东西。 3D 人体模型、施救位置、操作步骤、动作演示都有,整个页面也可以直接操作和交互。 而一个完整的 3D 网页,恰好把 Agent 面对的另一类问题暴露了出来。 今天能力比较强的模型接上 Coding、搜索、文件系统和运行环境,都能完成相当复杂的任务。 真正难的,正在从能不能做,变成能不能稳定地做完。 一个复杂任务可能涉及几十甚至上百步操作。 前面查到的信息能不能被后面的步骤正确使用,代码报错后能不能恢复,工具返回意外结果会不会把整个任务带偏,最后的产物有没有经过独立验证。 任何一步出问题,都可能沿着任务链一路放大。 单步能力越来越强之后,长链路里的错误累积、状态保持和结果验证,反而变得越来越重要。 这也是 Atria Dawn Preview 比较强调 Harness、环境和 Verifiable Experience 的原因。 模型负责理解、推理和行动,Harness 负责维持目标、状态、上下文和错误恢复,环境则提供真实反馈和验证依据。 这套思路关注的已经不只是模型单次回答有多聪明。 而是把模型放进一个真实任务里,它能连续干多久,出错之后能不能拉回来,最后交付的结果又能不能被验证。 模型能力决定单步能走多聪明。 Agent 系统决定这些聪明的单步,能不能最终连成一个可靠的结果。 现在模型的单步能力已经卷得很高了。 AI下一阶段真正值得看的,可能就是谁能把这些能力稳定地串起来。

李岳

37,669 Aufrufe • vor 23 Tagen

谁能想到Jev 居然输给了一个 1.88B 本地开源模型🔥 结果真的有点让我意外: 我做了一个贪吃蛇决策游戏 Jev 30:28 险胜,但是换成同一组 68 道决策题,本地模型准确率直接做到 94.1%,Jev 只有 76.5% 一个错了 4 道题,一个错了 16 道题 我本来只是想测试一下 “小模型决策能力怎么?”,结果我抽完发现,小模型虽然小 但是准确率一点也不低。 1️⃣ 先说我是怎么测的 双方使用完全一样的 12×12 棋盘、随机种子、碰撞过滤和路径规划器,只有遇到多个方向都能走的时候,才把选择交给模型。 最后 Jev 吃到 30 个食物,跑满 256 步 本地模型吃到 28 个,在 239 步被困住。 如果单看这一局的成绩,肯定是Jev 赢了。 但是贪吃蛇只是某一步选错以后,后面整条路线都会变,所以我又补了固定的 68 道决策题。 结果 this-that-model-1.0 答对 64/68,94.1%;Jev 是 52/68,76.5%。 Brier Score 也分别是 0.042 vs 0.133,本地模型给出的概率和真实结果更贴近 2️⃣ 这个模型最离谱的地方,是它只有 1.88B this-that-model-1.0 是一个开源的结构化决策模型,MIT License,可以直接在 Mac 本地跑 它和 Jev 的思路其实很像: 不给你写小作文,也不慢慢吐 Token 给它当前状态、一个问题、几个候选答案,它一次前向直接返回: 选哪个 + 每个选项的概率。 所以任务分流、选 Skill、队列选择、标签判断、Agent 下一步动作这种事情,都很适合 我在 M4 上直接用 MPS + FP16 跑,不需要 API Key,也没有网络请求 不同任务中位延迟大概 225~475ms,Snake 实战中位 475ms,平均约 492ms 一个 1.88B 模型,在 Mac 上已经可以做到亚秒级决策。 这个我觉得挺夸张 3️⃣ 我又单独测了 105 道空间决策题 总准确率 84.8%,随机基线只有 34.3% 其中 Snake 状态题、行列文字状态都是 100%,JSON 状态也有 94.4%。 而且输出特别干净。 没有 JSON 少个括号,也不会突然给你解释人生,只会老老实实从候选答案里面选一个,再把概率交给程序 对于 Agent 来说,这种“无聊”反而挺值钱。 4️⃣ 当然它也不是万能的 完整地图测试只有 60.7%,最短路径距离题更是掉到 28.6% 一旦任务需要真正的多步图搜索、连续计算,它就明显不行了 所以这次结果也不能简单理解成: 1.88B 打败 Jev 贪吃蛇单局上是 Jev 赢了,而且 Jev 这次没有保存同条件延迟数据,速度也没法公平比较 真正让我感兴趣的是另一件事: 很多 Agent 里面那些高频、重复、答案明确的小判断,可能根本没必要每次都调用一个大模型,甚至连云端 Jev 都不一定需要。 一个 1.88B、本地运行、一次前向就结束的模型,已经可以完成绝大多数简单的决策了。 一些无关痛痒的简单的决策都可以交给这种小的本地模式、遇到复杂的任务再交给 GPT、Claude这样的大模型可能会更适合。 我现在越来越觉得,未来 Agent 不一定是“所有事情都找最强模型”。 更可能是: 小模型负责做大量的决策,大模型才是真正的为了我们的工作服务。 如果你们感兴趣 也可以部署一下,再偷偷地补充一句 这个可是很牛的牛津团队开源的:

小墨同学

34,654 Aufrufe • vor 16 Tagen

最近国内几个模型大厂好像摊上事了? 也不知道真事假事,还是那个姓A的在碰瓷挑事! 吃瓜的时候,突然刷到一个新模型! 乍一看Atria ASI,差点看成了是Astra,真的很像, 模型代号叫 Atria Dawn Preview! 据说背后约三分之二的研发成员还是高校在校学生!! 我是真想知道这群学生能把模型做成什么样? 所以,找了很久才找到了API,接入下来测试了一下, 我用它一句话做个 3D 家装工作台,最后出来的效果居然还可以!! 能画户型、拖家具、改尺寸、保存项目、导出截图、还能自由拖放布置家具, 其实这个任务倒是不难,主要我一句话说的很笼统, 需要它能够理解我的意图,并且准确规划,将这个工作台做的尽可能完善。 但其实,写代码还并不是这个模型的主要能力。 它的定位,是面向科研和专业工作的智能体模型,擅长把一个复杂任务继续往前推进,最终变成可运行、可检查、可使用的成果。 比如从一个问题、一份数据、一段代码或者一篇论文出发,它可以继续完成资料检索、代码实现、实验执行和反馈修正,最后交付研究报告、软件系统、文档表格、演示文稿、三维设计等等。 可以用来做科研、写报告、写代码、画CAD!! 不知道这个API能用多久,后面我可以再测试一下不同的场景。 有兴趣可以持续关注一下!

沐阳

37,855 Aufrufe • vor 24 Tagen

昨天发了一个视频,看到评论里有人问:你都在用 Claude Code 了,为什么还要用国内的 Coding Plan? 对我来说,这不是一个二选一的问题,而是一个补充题。 大家都知道御三家的硬实力更强,这点没什么好争议的。但很多日常场景里,国产模型其实已经能在速度、质量、成本之间取得一个不错的平衡。 比如文本处理、资料整理、基础 coding、简单 agent 任务,这类占日常 80% 的工作,很多时候并不一定非要上最贵的模型。对大多数中国用户来说,国产模型更顺手,速度也够,价格还低不少。 还有一个经常被忽略的点,其实是处理速度。 我自己实测下来,国内这些模型在一些简单任务上,接口响应和首字速度都很快。像翻译、语音输入后的文本修正、基础润色、简单改写这类高频小任务,用起来其实很舒服。你并不需要每一次都把最贵、最强的模型拉出来跑一遍。 另外我觉得,现在国内头部几家 AI 厂商,已经不是“能不能做”的问题了。无论是阿里还是字节,一方面有足够的算力和基础设施,另一方面本身也有持续做模型研发和产品迭代的能力。所以在很多高频、日常、成本敏感的场景里,把国产模型纳入自己的工具链,本来就是很自然的事。 所以我现在的看法一直都不是“国产替代”或者“二选一”,而是按场景分工:复杂、高价值任务交给最强模型;大量日常、重复、成本敏感的任务,用国产模型做补充,我觉得这反而是更现实、也更科学的用法。

luolei

32,630 Aufrufe • vor 6 Monaten

Claude Opus 4.8 出了之后,我的第一反应是:想试。 第二反应是:算了,token 这东西真的不经烧。 结果看到 ZenMux 现在可以体验 Opus 4.8,就拿它试了一个我最近一直想做的小东西。 我自己有个很真实的问题: 脑子里经常冒出各种产品想法。 但每次真要开始做,就会卡住。 用户是谁? 第一版到底做什么? 哪些功能应该先砍掉? 怎么定价? 第一周从哪一步开始? 上线后怎么找第一批用户? 想法很多,执行很散。 所以我让 Claude Opus 4.8 做了一个「一人公司作战室」。 需求我写得也挺直接: 输入一句产品 idea。 自动拆出产品定位、MVP、开发任务、定价方案。 再生成落地页文案、冷启动实验、风险清单和本周计划。 最好不是一个静态页面,而是真的能点、能改、能导出。 然后我就把这段话丢给 Claude Opus 4.8。 出来的效果比我预期好不少。 它真的把“一人公司怎么从想法走到执行”这件事拆开了。 左边输入产品想法。 中间生成产品蓝图、MVP 范围、定价和官网文案。 右边是任务看板和本周计划。 底部还有冷启动实验、风险雷达和 Markdown 导出。 最让我觉得有意思的是,它不是一味堆功能。 比如我输入“给小红书博主做 AI 选题助手”,它会主动判断: 第一版必须做什么。 哪些功能看起来高级,但现在应该先别碰。 怎么找第一批真实用户。 哪些风险可能让这个项目做不下去。 这点就很能体现 Opus 4.8 的能力。 普通模型经常是:你要什么,我全给你加上。 最后页面很热闹,但产品判断是空的。 Opus 4.8 更像是在帮你收敛:先想清楚用户、场景和第一步,再把它变成可以执行的工作台。 我是在 ZenMux 上试的。 它比较方便的一点是,一个 Key 就能切不同模型,新模型上线也很快。 Opus 4.8 拿来做这种带产品判断、交互状态和复杂信息结构的网页,确实挺顺。 想试 Claude Opus 4.8 的,可以从这里进:

Joruno

16,224 Aufrufe • vor 4 Monaten

Jev 居然输给了一个 1.88B 本地模型?我用俄罗斯方块重新测了一遍 当我看到 this-that-model-1.0 在 68 道决策题上做到 94.1% 准确率,而 Jev 是 76.5% 时,我的第一反应是: 这是真的假的? 一个只有 1.88B 参数、可以在 Mac 本地运行的小模型,真的能在决策任务上超过 Jev 吗? 所以我做了一个俄罗斯方块,让两个模型使用相同的棋盘规则、随机种子和方块顺序。程序负责计算所有合法落点,模型只负责决定方块应该放在哪里。 1️⃣ 一开始,Jev 的表现更好 最初,我先过滤掉明显更差的落点,再把剩下的多个候选位置同时交给模型。 在这一模式下,Jev 的表现更加稳定。 我观察到的一轮里: Jev 消除了 5 行,this-that 消除了 3 行。 如果只看到这里,很容易得出结论:本地小模型还是不如 Jev。 但我后来意识到,这种问题可能并不是 this-that 最擅长的形式。 2️⃣ 换成“二选一”后,结果反了 this-that 本质上是一个 typed decision model,更擅长候选明确、边界清楚的选择题。 所以我把决策方式改成了淘汰赛: A 和 B,哪个落点更好? 胜者进入下一轮,继续和其他候选位置比较,直到选出最终落点。 换成这种模式后,我观察到的一轮结果变成了: this-that 消除了 7 行,Jev 只消除了 1 行。 this-that 的棋盘也更加平整,留下的空洞更少。 模型没有变,游戏没有变。 唯一改变的,是我向模型提问的方式。 3️⃣ 这个模型特别在哪里? this-that-model-1.0 只有约 18.8 亿参数,采用 MIT License,可以下载到本地运行。 它不写小作文,也不慢慢生成 Token。 你给它当前状态、一个问题和几个合法选项,它通过一次前向计算直接返回: 选择哪个 + 每个选项的概率 因此它很适合任务分流、Skill 选择、队列判断、风险分级,以及 Agent 下一步动作这类高频决策。 官方模型卡公布的 68 道决策题中,this-that 答对 64 道,准确率 94.1%;Jev 答对 52 道,准确率 76.5%。 在概率校准指标上,this-that 的 Brier Score 是 0.042,Jev 是 0.133。数值越低,代表模型给出的概率与实际结果越接近。 4️⃣ 但这不代表 Jev 被全面打败了 俄罗斯方块是一条连续决策链,前面一个方块放错位置,后面的棋盘状态就会完全不同。单局结果不能代表模型的完整能力。 而且二选一虽然降低了每次判断的难度,却需要进行更多次模型调用,总延迟不一定更低。 所以更准确的结论不是“this-that 全面强于 Jev”,而是: Jev 更适合某些信息丰富的综合比较;this-that 更适合高频、明确、封闭选项的结构化判断。 这次实验真正让我感兴趣的是: 未来的 Agent 可能不应该所有事情都找最强模型。 高频、重复、答案明确的小判断,可以交给本地小模型;真正复杂的推理与生成任务,再交给 GPT、Claude 等大模型。 有时候,决定结果的不只是模型大小。 还包括:你有没有把问题问成它擅长回答的样子。 因为这个模型够小,其实普通电脑也可以部署,大家有需要的可以看下这个开源模型的介绍,链接我放评论区了👇🏻

阿蔺A-Lin

22,001 Aufrufe • vor 16 Tagen

到现在都难以相信,Apodex 居然开源了!! 我一度认为非常有商业价值的产品! 还记得第一次用它,惊艳程度不亚于我第一次用Manus! 这次,Apodex 开源正式发布了新版本 Apodex 1.1, 并且提出了一个我非常认可的概念: AI的能力单位,不应该是一次回答,而应该是一项完整任务。 什么意思?一个AI真正想进入工作流,至少要做到几件事: 理解目标、进入真实环境、维持长任务状态、根据中间结果不断调整计划、任务失败后修复、最后交付一份可以核查的成果。 最近刚好在做一个AI项目,是一个工作台,需要评估不同模型组合选型的成本, 为了测试Apodex能做到什么程度,我把模型价格、评测数据和具体场景需求给到它,让它根据我的需求,为四类业务场景完成 AI 模型/API 选型,统一不同厂商的价格口径,计算月度成本,同时满足性能、上下文、工具能力、预算和供应商集中度约束。 它拿到的是不同格式、不同统计口径的数据,有些数据可能不够准确,有些需要清洗,有些需要重新计算。 Apodex没有上来就写报告,它先在Task Board里拆解整个任务,然后根据任务自动组织Agent Team。 第一轮,它已经完成了数据清洗、价格标准化、模型筛选和成本测算, 然后我临时补充了新的需求: 没错,在任务中我可以随时“插话”,补充新的文件和想法。 *中文内容生成的月请求量,从 12 万提高到 24 万; *深度研究中 30% 的场景,必须转到自建环境; *长文档审阅全部涉及敏感文件,也必须本地运行; *月预算不变; 普通AI看到这一堆新的需求,一般都会重新跑一遍。 但Apodex并没有!它保留了原始数据、价格归一化方法、峰谷计价规则和已经验证的计算口径,没有变化的部分原样保留,只是重新调整了变化的部分! 它可以在任务过程中动态调整任务计划!! 这个可能是这个版本最大的一个更新!Apodex 1.1 就像是在维护一个持续变化的任务状态: 它要读取真实文件、拆解工作、推进计算,还要接收中途反馈,判断保留仍然成立的成果,只修正受影响的部分,最后把结果交付成可以继续使用和核查的文件。 这可能才是复杂任务型 Agent 真正应该具备的工作能力。 最后,它交付了两份不同粒度的报告,以及一个包含 18 个工作表的 Excel 成本模型;其中专门新增了“变更与场景”“云 API 重算”“本地候选筛选”“本地 TCO 缺失假设”“保留 vs 受影响”5 张表。 整个过程,特别丝滑。 这也是Apodex 1.1这次最核心的变化:进入真实任务的执行过程。 而所谓真实任务的执行,其实就是你随时可以甩给AI新的资料和要求,而它会有条不紊的把任务进行下去,直到交付给你完整可验证的结果!

沐阳

50,283 Aufrufe • vor 1 Monat

微软研发的 AutoGen 框架太强大了,它是一个多代理框架,利用它可以轻松定制一系列工作任务。 举一个常见的例子:我们要实现一个爬虫程序,抓取并保存网页图片。如果把这个任务丢给 ChatGPT,它会直接返回一串可执行代码,但是代码通常会存在问题,例如执行报错、缺少依赖等,你需要反复跟 ChatGPT 对话来完善程序。当然,我们也可以设定一个复杂 Prompt,要求它调用 ChatGPT 的代码执行插件,如果存在报错,则继续修正程序。 这个任务如果交给 AutoGen 来实现,将会变得无比简单,几行代码就可以搞定: 1)定义一个 Assistant Agent,它的任务是解决问题 2)定义一个 UserProxy Agent,它的任务是替代人询问问题,同时在本地执行程序 这两个 Agent 都不需要给他们设置 Prompt。当我们把爬虫任务交给 UserProxy 后,它会理解任务,然后询问 Assistant 应该如何做,Assistant 会把操作过程告诉 UserProxy,接着 UserProxy 会根据指示在本地安装依赖,然后创建文件执行代码,如果执行出现错误,它会把详细报错提交给 Assistant,依次循环,直到可以获取到最终的结果。任务结束的时候,你会看到目标图片已经保存到本地磁盘了。 利用这个框架可以做的事情非常多,它提供的能力也十分完善,可以在项目的 notebook 中找到很多最佳实践: P.S. 为了确保安全,还是建议你在 Docker 环境中执行程序,UserProxy 有一个 code_execution_config 配置,将 use_docker 配置为 True 即可;另外,它还有一个 human_input_mode 参数,设置为 NEVER,表示整个过程都不需要人参与,也可以设置为其他值,它会等待人的输入后再进行下一步操作,这个设计可以让人参与到任务执行过程,避免跑偏。

Barret李靖

518,852 Aufrufe • vor 3 Jahren

AI 每天都在干活,最后为什么只长了数据库? 现在做 Agent,很容易产生一种虚假的繁荣。 日志越来越多,向量库越来越大,接入的工具越来越全,工作流也越来越复杂。 系统看起来什么都留下了。 可下一项相似任务到来时,模型的判断未必比上一次更好。 这就像一个员工每天写十页工作日报。年底一看,硬盘写满了,脑子还停在年初。 存得更多,不等于学得更多。 今天很多 AI 缺的不是第二块硬盘,而是一条能把真实工作变成模型能力的路。 我更愿意把它叫作:能力复利。 工具解决的是“这一次能不能完成”;能力复利解决的是“这一次完成之后,下一次能不能更好”。 这件事必须从完整的工作现场开始。 客户之前说过什么,项目为什么这样决策,哪些方案被否决,谁修改了结果,最终反馈发生在什么时间——如果这些信息散落在邮件、会议、文档和聊天记录里,模型看到的就只是几个孤立碎片。 Alloomi 的 Holistic Context,试图把分散的信息重新组织成一个持续变化的业务世界。 在验证跨会话问答、时间关系和多跳推理的 LoCoMo‑V2 上,取得 97.4%,对照 Mem0‑V3 的 92.5%。 在验证长期信息提取、知识更新和多会话综合推理的 LongMemEval‑S 上,取得 97.6%,对照 Mem0‑V3 的 94.4%;该项公开人类参考为 82.9%。 在千万 Token 历史规模下测试全局理解与信息定位的 BEAM 10M 上,取得 67.0%,对照 Hindsight 的 64.1%。 这些数据背后真正重要的,不是给 AI 增加一个更大的记忆库。 而是让它理解一件事情为什么发生、怎样变化,又是如何走到最终结果的。 当工作现场被完整还原,真正困难的部分才刚刚开始: 这些经历,能不能改变模型下一次的判断? 一次真实任务会留下 Context、Decision 和 Feedback:模型当时看见了什么、做出了什么选择、最后获得了怎样的反馈。 但并不是所有轨迹都值得学习。 错误判断、偶然成功和低质量反馈如果直接进入训练,模型不但不会进化,反而可能把错误放大。 所以 Alloomi 的 Self‑Evolving Agent 会先进行质量筛选和专家锚定,再通过 Online LoRA、跨任务回放与能力蒸馏,把有效经验逐步写入模型。 在验证从复杂上下文中学习新规则并用于后续执行的 CL‑Bench 上,SEA 取得 47.6%,同基座参考为21.5%。 在验证长周期、多阶段经验积累与迁移的 CL‑Bench‑Life 上,取得 32.1%,公开榜单中的 GPT 5.5(High)为22.2%。 在验证跨任务持续学习、环境适应和抗遗忘的 Con.L Bench 上,取得 32.6%,对照 Claude Sonnet 4.6 的22.3%。 跨模型成绩更适合观察公开榜单位置。真正能够判断框架贡献的,仍然是相同基座和相同评测条件下,21.5% 到47.6%的变化。 因为数据库保存的是“曾经发生过什么”。 训练改变的是“以后遇到类似问题会怎么做”。 但能力进入模型,还不能算完成。 最后仍然要回到现实世界,接受一个很朴素的检查: 代码修好了吗?报告能交吗?复杂任务形成了可以验收的结果吗? 在覆盖高经济价值职业任务的 GDPval‑AA Normalized 上,Alloomi 取得 74.2%,对照 Claude Opus 5 的67.9%。 在验证真实职业工作流与专业交付的 JobBench 上,取得57.5%,报告列出的公开参考为54.7%。 在验证真实 GitHub 问题修复、连续软件工程经验迁移和抗遗忘能力的 SWE‑Bench‑CL 上,取得80.6%,对照 OpenCode、Kimi K3 与 FAISS 组合方案的73.3%。 从真实工作进入上下文,从任务反馈进入训练,再从模型能力回到专业交付,这才构成一条完整的成长路径: 真实任务轨迹 → 质量筛选 → 专家锚定 → 后训练 → 评测准入 → 版本回滚。 效果变好,新的能力才能进入下一版本;如果更新破坏了旧能力,系统就回滚。 所以,自进化不是让模型随意修改自己。 而是让它在可验证、可审计、可撤销的条件下持续成长。 过去我们看 Agent,喜欢看第一次 Demo 有多惊艳。 但 Demo 看的是峰值,长期工作看的是斜率。 真正值得观察的,不是它今天执行了多少任务,而是这些任务有没有让能力曲线继续向上。 工具的价值,是帮 AI 做完一件事。 自进化的价值,是让这件事没有白做。 这就是 Alloomi 想建立的能力复利: 让 AI 每完成一次交付,就获得一次成长。 AlloomiAI

知识猫AI实验室

12,802 Aufrufe • vor 1 Monat

国产最新的多模态模型来了!! 前两周我刚体验过国产的阶跃星辰大模型,没想到这么快他们的新模型 Step 3.7 Flash 就出了。 现在大模型一发布必卷 benchmark 分数,但真正做 Agent 的人都清楚:跑分高 ≠ 能把活干完。 所以这次阶跃星辰的新模型 Step 3.7 Flash 它再不追求单点最聪明、也不只是单次最快,而是主打“生产任务端到端执行效率”。 一个真实的 Agent 任务从来不是一次问答,而是规划 → 搜索 → 工具调用 → 代码生成 → 多模态理解 → 反复校验的完整闭环,Step 3.7 Flash 这次升级的重点是整条链路的效率,而不是某个孤立指标。 提几个我觉得挺务实的点: 1. 原生多模态模型:它可以直接处理 UI 截图、图表、仪表盘、文档,原生读懂并转成结构化输出和可执行步骤,不需要像一些模型那样外挂视觉理解 MCP,而且现在多模态是顶级模型的标配。 2. 推理加入搜索和视觉检索:网页搜索、图像搜索、视觉验证、多源信息比对,让 Agent 在开放任务里边查边验证边行动,而不是事后再接个外部工具。 3. 198B MoE、约 11B 激活参数,最高 400 TPS:稀疏激活 + 这个速度,意味着高频交互、多步工作流、反复工具调用的场景下,单位任务的成本和延迟都压得很低——快和省是一起来的。 4. 开源、可部署:生产环境要的不只是 API,还有透明度、可控性和部署灵活性。 如果你在做 AI Agent、coding 工作流、搜索类应用或多模态系统,值得用 StepFun 试试这款新模型的能力。 想看更进阶的平台能力,可以了解 Step Plan。 海外平台: 国内平台:

耳朵

12,345 Aufrufe • vor 4 Monaten

试了一下 OpenAI 新出的 Codex App,有些亮点 跟 Skills 的适配还是有点问题,模型的主要问题就是慢 OpenAI 给 Pro 和 Plus 用户的 Codex 额度在未来两个月内全部翻倍了 👇看一下详细的能力介绍: Skills 可视化管理 有一个专门的 Skills 列表界面,预置了一些官方 skills,也可以扫描你已经安装的 skills。注意这里只能扫描 NPX 安装的,本地创建的(比如在 Claude Code 里创建的)扫不出来。 还支持 Skills Creator 创建的 skills,可以直接在 APP 里用它去创建新 skills。 ------ 定时任务功能,这个挺实用的。 可以让 AI 定期执行某些任务,比如每周给你一个解决问题的报告,定期去解决某个项目的 PR 问题,或者定期 review 代码。 对于需要持续维护的项目来说,这个功能还是挺有价值的。 ------ Codex APP 现在支持计划模式了。 因为它跟 Codex CLI 共享后端,所以现在 Codex CLI 也同步支持计划模式了。这意味着 AI 会先规划任务步骤,让你确认后再执行。 ------ 用量显示的样式做得挺好的。 进度条、余量、使用情况都很清楚,一眼就能看到你还有多少额度。 还有 code review 的快捷方式,可以快速调用你的 skills。MCP 的添加也支持。 ====== 实测:用 video-wrapper skill 跑了一遍 我测试主要是让它跑了一个我最近做的 skill,可以一键给视频添加视频包装,比如卡片、花字、人物条、章节标题这些。 这个 skill 挺复杂的,所以很适合用来测试。 ------ 第一次运行的问题 可以工作,但第一次它选了 PIL 这个方案,比较差。 核心问题是什么?它跟你没有交互。 我的 skill 里边写清楚了:要先问用户要哪套方案,再给出包装方案让用户确认,用户确认了再开始包装。 但在 Codex 这里,明显没有交互。它就直接跑,把所有决定都自己做了,跑完就完了。出错了也不管,直接用降级方案。 ------ 修复后的效果 我让它修复以后,它倒是能修复。重新跑了一遍,效果也不错。 最终生成的视频包装效果还行: ▸ 左下角有人物卡片 ▸ 有花字 ▸ 有各种卡片和章节标题 ▸ 结论卡片也加上了 因为我们用前端代码约束了样式,所以它在样式上不会出什么错误。 ------ 体验总结 整个过程很不可控: ▸ 速度很慢 - Codex 本身速度就慢 ▸ 交互明显不够 - 你根本不知道进到哪个阶段了,也不知道它的方案是什么 ▸ 只管执行 - AI 一直在执行,不会停下来问你 可能是它不太适应 skills 规范,只是简单做了一下适配,没有 Claude Code 跟 skills 的适配那么好。

歸藏(guizang.ai)

30,595 Aufrufe • vor 8 Monaten