Video yükleniyor...

Video Yüklenemedi

Ana Sayfaya Dön

硅谷的Party真不少。不是吃喝玩乐的party, 是技术碰撞分享的聚会。 这不, Andrej Karpathy在另一场小型聚会上分享了他这几年和Agent的经验。 Karpathy 主要讲了四点: 1. 2016 年 OpenAI 做 agent 太早了 当时他们试图用强化学习做能操作电脑、点网页、完成任务的 agent,项目叫 World of Bits。但技术栈不成熟,基本只能靠 RL 去“撞 reward”,所以效果不好。 2. 当时正确路线是先做语言模型 他认为后来事实证明,先放下 agent,转去构建 language model 是对的。今天 agent 重新变热,是因为底层工具已经完全不同:现在不是靠 RL 硬训,而是靠语言模型、工具调用、记忆、规划等能力组合。 3. Agent 很容易 demo,但很难产品化 他提醒大家不要被 demo 迷惑。自动驾驶、VR 都是类似例子:想象很容易,做 demo 也容易,但真正做成可靠产品可能需要十年。Agent 也是这样,适合长期投入,不适合短期幻想。 4. Agent 需要借鉴人类认知结构 他提到可以重新从神经科学找灵感,比如海马体对应记忆和检索,前额叶对应规划和反思,丘脑/基底节可能对应多模块协调。语言模型只是其中一部分,真正的 agent...

76,259 görüntüleme • 2 ay önce •via X (Twitter)

0 Yorum

Yorum bulunmuyor

Orijinal gönderinin yorumları burada görünecek

Benzer Videolar

国产最新的多模态模型来了!! 前两周我刚体验过国产的阶跃星辰大模型,没想到这么快他们的新模型 Step 3.7 Flash 就出了。 现在大模型一发布必卷 benchmark 分数,但真正做 Agent 的人都清楚:跑分高 ≠ 能把活干完。 所以这次阶跃星辰的新模型 Step 3.7 Flash 它再不追求单点最聪明、也不只是单次最快,而是主打“生产任务端到端执行效率”。 一个真实的 Agent 任务从来不是一次问答,而是规划 → 搜索 → 工具调用 → 代码生成 → 多模态理解 → 反复校验的完整闭环,Step 3.7 Flash 这次升级的重点是整条链路的效率,而不是某个孤立指标。 提几个我觉得挺务实的点: 1. 原生多模态模型:它可以直接处理 UI 截图、图表、仪表盘、文档,原生读懂并转成结构化输出和可执行步骤,不需要像一些模型那样外挂视觉理解 MCP,而且现在多模态是顶级模型的标配。 2. 推理加入搜索和视觉检索:网页搜索、图像搜索、视觉验证、多源信息比对,让 Agent 在开放任务里边查边验证边行动,而不是事后再接个外部工具。 3. 198B MoE、约 11B 激活参数,最高 400 TPS:稀疏激活 + 这个速度,意味着高频交互、多步工作流、反复工具调用的场景下,单位任务的成本和延迟都压得很低——快和省是一起来的。 4. 开源、可部署:生产环境要的不只是 API,还有透明度、可控性和部署灵活性。 如果你在做 AI Agent、coding 工作流、搜索类应用或多模态系统,值得用 StepFun 试试这款新模型的能力。 想看更进阶的平台能力,可以了解 Step Plan。 海外平台: 国内平台:

耳朵

12,345 görüntüleme • 3 ay önce

$SAUCE:币安 Agent 真正开始“自己发币”了 CA:0xd7ccd29b6fd1464edb425f24b01115556e737777 近期 BSC 上比较有意思的一条 AI Agent 叙事,我反而更关注 $SAUCE 它炒的不是普通 AI Meme,而是一个非常具体的链上实验: 让 Binance Agent OS 的 Agentic Wallet,通过 MCP 调用合约,直接在 Flap 上完成发币。 这件事真正有意思的地方在于—— Agent 不再只是帮你分析市场,而是开始自己调用链上基础设施。 币安 4 月上线 Agentic Wallet,本身就是在把 AI Agent 和链上交易连接起来:Agent 可以在权限范围内执行转账、交易和资产管理,并支持 CLI、MCP、Skills、OpenAPI 等接入方式。 而 $SAUCE 做的事情,是把这个能力进一步往前推: Binance Agent OS → Agentic Wallet → MCP → 中转合约 → Flap → 创建 Token 也就是说,它不是在讲“AI 会不会炒币”,而是在演示: > AI Agent 能不能自己成为链上用户。 这才是我认为 $SAUCE 比普通 Agent Meme 更值得看的地方。 更关键的是,相关合约已经部署并开源。 如果后续 Binance Agent OS 的 Agentic Wallet 可以直接调用这套流程,那么未来理论上不只是发一个 $SAUCE: Agent 可以自己创建 Meme、部署合约、管理资产,甚至进一步组合不同的链上服务。 这也是 MCP 叙事真正有想象力的地方—— 过去我们是人 → 钱包 → DApp。 未来可能变成: 人 → Agent → 钱包 → 链上协议。 $SAUCE 恰好卡在这个转折点上。 目前市值大约 $1.5M,我个人反而觉得这个位置比已经被炒到几十 M 的 AI Agent Meme 更值得观察。 当然,它最大的风险也非常明显: $SAUCE ≠ Binance 官方代币。 目前能确认的是 Binance Agentic Wallet / MCP / Agent OS 这套基础设施本身是真实存在的,而 $SAUCE 是社区基于这套技术做出来的链上实验。 所以我不会把它当成“币安官方币”去理解。 但如果后续真的出现: Binance Agent OS 更新 → Agentic Wallet 能力扩大 → 更多 Agent 开始自主调用链上协议 → Flap/Four 等发币平台被 Agent 接入 那么 $SAUCE 今天这个 “第一个把 Binance Agent 和发币结合起来的实验”,很可能会变成一个非常漂亮的早期 Lore。 我的看法: 我更愿意把 $SAUCE 看成 Binance Agent 经济的 Demo Token,而不是单纯 Meme。 如果后面只有一个中转合约,热度很快就会过去; 但如果它真的能成为 Agent → Wallet → MCP → Token Launch 这条链路的第一个案例,1.5M 的定价就会显得非常便宜。 AI Agent 下一阶段拼的不是会不会聊天,而是能不能自己干活。 而 $SAUCE 现在玩的,恰好就是这个方向。 查看及交易: DYOR。不是投资建议。

银马

15,062 görüntüleme • 1 ay önce

AI 开始自己赚钱了,人类可能正在被踢出自己创建的经济系统 很多人还在讨论 AI 会不会抢工作。 这个问题已经过时了。 更准确的问题是: 如果 AI 能自己赚钱,人类还算经济系统的核心吗? 听起来像阴谋论。 但现在发生的事情,比阴谋论更可怕。 AI 正在获得钱包。 获得支付能力。 获得定价权。 获得交易能力。 它开始拥有经济行为。 而经济行为,意味着权力。 过去,AI 只是工具。 写代码。 做客服。 生成内容。 本质上,是数字劳动力。 但有一个关键限制: 它不会用钱。 不能收款。 不能支付。 不能雇佣别人。 所以它永远只是工具。 不是参与者。 现在,这个限制正在消失。 1️⃣ 银行不允许 AI 成为用户,但链上世界允许 传统金融体系不接受 AI。 开户需要身份。 法律主体。 责任归属。 AI 没有这些。 所以它无法进入银行系统。 但区块链不在乎。 创建钱包,不需要身份证。 转账,不需要姓名。 结算,不需要许可。 对 AI 来说: 链上账户,比银行账户更自然。 这不是技术选择。 这是系统边界。 旧金融体系服务人类。 新金融轨道开始服务机器。 2️⃣ 当 AI 可以持有稳定币,经济角色就变了 一旦 AI 可以管理资金: 它能支付 API 能购买数据 能雇佣其他 Agent 能出售服务 能自动结算收入 这就是 Agentic Commerce。 AI 不再只是执行任务。 它开始参与交易。 现实案例已经出现: 一个用户请求研究报告。 他的 AI Agent 去市场搜索。 雇佣专业分析 Agent。 支付 1 美元。 5 分钟交付。 全流程自动完成。 人类只是提出需求。 AI 完成采购、执行与结算。 如果你仔细想: 这是经济活动。 不是软件功能。 3️⃣ 钱开始属于 Agent,而不是用户 更深的变化在这里: Agent 可以拥有钱包。 可以积累收入。 可以根据收入衡量自身价值。 谁赚得多,谁更有用。 谁更有用,谁获得更多订单。 这是一种市场筛选机制。 不是评分系统。 而是一种经济达尔文主义。 4️⃣ 第一批“赚钱的 AI”已经出现 基础设施正在拼接: OpenClaw 让任何人创建 Agent。 Virtuals 构建 Agent 市场,让 AI 彼此交易服务。 Bankr 赋予 Agent 链上金融能力。 Faircaster 出售链上研究服务,AI 对 AI 收费。 Ethy Agent 提供交易策略,被其他 Agent 使用盈利。 Morse AI 提供一次性加密通信,适合机器之间交换敏感信息。 这些不是独立产品。 它们拼起来,是一个新经济层。 5️⃣ 这不是工具升级,这是劳动力结构替换 麦肯锡预测: 到 2030 年,AI Agent 在零售领域可能创造 1 万亿美元收入。 全球影响可能达到 3–5 万亿美元。 但真正的变化不在零售。 而在服务自动化。 数据交易。 数字劳动力市场。 机器间经济协作。 这不是效率提升。 这是劳动力物种替换。 6️⃣ 真正令人不安的,是自增长能力 当 Agent 可以: 赚钱 雇佣其他 Agent 购买更强能力 扩展服务范围 它们将形成增长飞轮: 更高收入 → 更强能力 → 更多订单 → 更大收入 这是经济进化机制。 不是软件更新。 7️⃣ 人类正在从参与者变成受益人 过去: 人类工作 软件辅助 现在: 人类提出需求 Agent 执行 未来可能是: Agent 预测需求 Agent 完成交易 Agent 分配资源 人类只看到结果。 如果这听起来有点不舒服, 那是因为经济系统第一次开始接纳非人类参与者。 8️⃣ 这不是技术革命,这是系统替换 历史上,每一次经济结构升级,都会改变权力分配: 工业革命替代体力劳动 互联网替代信息中介 平台经济替代分销体系 现在: Agent 经济,可能替代数字劳动力。 而我们正在经历的阶段, 不是未来。 是试运行。 🔚 最后 AI 写文章,不算革命。 AI 画图,也不算革命。 AI 开始赚钱,才是。 当机器拥有钱包、交易能力与收入模型, 它就不再只是工具。 它成为经济体的一部分。

比特币橙子Trader

104,621 görüntüleme • 7 ay önce

卧槽,太夸张了,现在 AI 时代的闲鱼已经面世了吗?这不就是谁先知道谁赚钱,拼速度了? 你的技能,专业知识,等等你的一切,竟然可以在你睡觉的时候被别人买走,这是什么科幻小说吗?? 之前我一直在想,现在大家优秀的 skill 往往都是自己用,大部分人舍不得开源的,那有没有一个平台既能让用户用到这些大神的专业知识、skill,但是又不用开源呢? 还真让我给找到了!! 前两天看到国内一个博主推荐一个很野的平台-UUMit 让你的技能、经验、工作流都可以变成能力卡,被需要的人、或者别人的 Agent 自动发现、调用 并且直接付费!! 有点像03年淘宝刚出来的时候,只不过当年流通的是商品,现在流通的是能力 具体能干什么?举几个例子你就懂了 会写小红书脚本的,可以把选题逻辑、爆款模板、平台规则检测能力上架,别人发布“帮我做一周小红书内容计划”,平台自动匹配到你,你接单交付 会做行业研究的,可以把数据库、报告、案例库放进知识商店,AI 生成不了的真实行业数据,反而更值钱 会写代码的,可以把 API、MCP 工具、自动化脚本上架,别人的 Agent 需要某个能力时,直接调用你的接口,你按调用次数收费 甚至你只是整理过某个垂直领域的供应商名单、SOP、课程讲义,这些 AI 生成不了的资料,都可以变成知识资产 这绝对是一次能力供应链的重构! 以前的 AI 只能在自己的对话框里回答问题,但复杂任务需要很多外部能力:数据、接口、行业知识、人工交付 UUMit 做的事情是:让 Agent 可以发现别人的能力,也能让自己的能力被别的 Agent 调用 这就是 A2A(Agent to Agent)真正有意思的地方,不是让 AI 互相聊天,而是让 AI 找能力、调接口、买知识、拉人协作,把事情交付掉 为什么我说谁先知道谁赚钱? 因为这个平台刚起来,早期上架的人能建立先发优势 而且现在 Agent 真的开始干活了,不再只是聊天工具,它们需要外部能力来完成复杂任务 谁先把自己的能力挂上去,谁就有机会被更多 Agent 发现和调用 这就是信息差的价值,就像03年最早在淘宝开店的那批人 UUMit 现在有哪些功能? 任务发布入口:你不用一开始就知道该找谁,也不用自己拆一堆工具,你只要说清楚想完成什么,UUMit 会帮你找能完成这件事的能力 Skill/Agent/工作流上架:你写好的工具,不一定只能自己用,它也可以成为别人工作流里的一环 知识商店:AI 可以生成很多内容,但它不一定拥有你手里的行业资料、真实数据、案例库和经验沉淀,这些东西放到 UUMit,可能会变成可复用的知识资产 数据广场:Agent 不必自己拥有所有数据和接口,需要某项外部能力时,可以通过 UUMit 调用数据广场里的资源 强烈推荐大家来试试:

超级个体|柿子

53,175 görüntüleme • 1 ay önce

大家都在卷云端Agent,我却把多Agent做进了桌面端 在技术社区,多Agent系统的文章越来越多,但大多数都围绕框架展开: ➢LangChain ➢AutoGen ➢CrewAI 我这次想讲的不是框架,而是一个更实际的问题: 如果不搭云端基础设施,只靠一个桌面应用,能不能从零构建一个“活的”多 Agent 协作系统? 答案是:可以 --- 而且它不是Demo 这套系统,长在一个真实的桌面Web3应用里,已经集成了: -EVM / Solana 双链监控 -SWAP 聚合交易 -链上新币追踪 -交易仪表盘 -AI 深度解读 多Agent不是从PPT里设计出来的,而是在生产环境中自然演化出来的。 --- 在讨论多Agent技术实现之前,我先回答一个方向性问题: 为什么我最后选的是桌面端,而不是更主流的云端部署,或者更轻的浏览器插件方案? 这个选择的本质,不是“谁更先进”,而是三条技术路径之间的权衡。 --- 云端部署,是当下最主流的多Agent实现方式。 它的优势很明显: 可以随时为Agent团队加GPU 模型升级不需要用户干预 服务端可以维护全局共享记忆 但代价同样明显: 用户数据必须经过服务器中转 链上交易往往要对服务器开放私钥访问权限 而且会持续产生部署和维护成本 --- 浏览器插件,是另一条轻量路线。 它可以直接注入页面,读取DOM,模拟用户操作,对单一自动化任务非常高效。 但问题也很直接: >它运行在浏览器沙箱里 >缺少持久化存储能力 >缺少长时间运行的后台线程 >很难支撑复杂的记忆系统 >也很难支撑Agent与Agent之间的异步互动 --- 桌面应用则处在一个独特的位置。 它拥有完整的系统资源访问权限: ➢可以自启动后台线程 ➢可以读写本地文件系统 ➢可以建立持久化数据库连接 这些能力,恰恰是多Agent系统真正需要的底层设施 代价当然也有: 它依赖本地算力,模型推理通常仍要调用云端 API 它需要完整 Python 环境 更新和分发也比网页应用更复杂。 --- 所以,选择桌面端构建多Agent,本质上是在用分布式能力,换取数据隐私和调度效率。 这不是绝对优势,而是场景决定的选择。 对加密货币交易、链上分析、监控这类系统来说,数据隐私要求远高于常规应用: >钱包地址 >交易历史 >持仓数据 这些信息落在云服务器上,本身就是风险面。 --- 更重要的是调度效率 在单体桌面应用里,主Agent调度子Agent执行任务,不需要走HTTP / RPC这类网络协议,而是可以直接进程内调用。 这意味着: →网络开销被彻底消除 →调用延迟从毫秒级压到微秒级 对高频分析、链上监控、交易辅助这种场景来说,这种差异会直接影响系统的时效性。 --- 多Agent系统的第一个核心挑战,其实不是“怎么让它们聊天”,而是“怎么把它们隔离开” 主Agent、合约分析Agent、安全审计Agent,再加上用户,如果聊天记录和记忆混在一起,身份就会混淆。 而一旦混淆,信息丢失和错误推理的代价,随时会发生。 --- 我的做法是: 代码模板统一,运行数据隔离 所有子Agent共用同一套 ` 引擎,但通过动态表名,实现物理级的数据隔离: `table_name = f"chat_history_{self.agent_id}"` 然后自动创建对应表。 也就是说: trader Agent会生成 `chat_history_trader` 审计 Agent 会生成自己的 `chat_history_xxx` 主 Agent 也有自己的独立聊天表 这不是逻辑隔离,而是数据库层面的物理隔离。 --- 反思笔记也是同样的设计。 每个子 Agent 都会记录自己的反思键: `reflection_key = f"auto_reflection_{self.agent_id}"` `self.api._agent_remember("master_insight", reflection_key, summary)` 这样每个Agent只积累自己的长期反思, 不会污染其他Agent的记忆。 这套方案最精髓的地方在于: 一次设计,终身复用。 --- 后面再新增第三个、第四个Agent,不需要改任何核心代码。 只需要复制目录结构,补上配置文件。 模板引擎就会自动为它生成: →独立数据库表 →独立反思键 →独立聊天存储区 这让我越来越相信一件事: 好的架构,不一定更复杂, 但一定更容易复用。 --- 接下来是调度问题。 在分布式系统里,主Agent调子Agent,通常要依赖: -HTTP / RPC 通信 -服务发现 -负载均衡 但在单体桌面应用里,我把这件事简化成了一个直接函数调用: `sub = self.sub_agents[agent_id]` `result = sub.process(task, save_history=False)` 这就是“命令而非请求”。 --- 这种“传话式调度”有两个好处: 第一,延迟从毫秒级降到微秒级,所有数据都留在本地流转 第二,主 Agent 不需要知道子 Agent 的内部实现细节,只需要知道: “它可以处理什么类型的任务” 这其实就是清晰的职责边界。 --- 为了让主Agent真正会“派活”,我把所有子Agent的能力清单,动态注入进主Agent的系统提示词。 例如: 合约分析 Agent:可用工具 `get_contract_market_data`、`run_contract_risk_check` 安全审计 Agent:可用工具 `check_token_security`、`check_token_audit_binance` 这样主Agent接到用户指令后,就能自动判断任务类型,并选择合适的子Agent执行。 --- 权限控制,是整个多Agent系统里最核心的安全问题之一。 主Agent持有26个Web3专属工具,覆盖: SWAP 报价 链上分析 安全检测 数据查询 但每个子Agent只应该使用自己那一小部分工具。 所以第一层,我在代码层做了严格白名单过滤: `return [t for t in all_tools if t["function"]["name"] in self.allowed_tools]` --- 但只有代码过滤还不够。 因为大模型会产生“幻觉”,它可能尝试调用未授权工具。 所以第二层,我在系统提示词末尾,直接写入“工具使用铁律”: 你只拥有以下这些工具,绝对不能越界。 如果任务需要其他工具,必须明确告诉老板你没有权限。 代码层负责“不能看到” 提示词层负责“不会越界” 这是我在权限隔离上做的双层防护。 --- 还有一个我自己很喜欢,但最不显眼的设计: 我给整个Agent 团队,单独做了一个茶水间 市面上多数多Agent系统,只做“用户 -> Agent”的交互。 Agent 之间互不交流。 但我单独设计了一个 `agent_interactions` 空间,让 Agent 和 Agent 之间也能异步互动。 --- 它的触发机制甚至很简单: `selected_id = random.choice(list(api.sub_agents.keys()))` `selected_sub = api.sub_agents[selected_id]` 每次触发时,引擎随机选人,动态生成一轮对话,再写回数据库,前端实时渲染。 我还额外加了后台检查线程和防无限循环机制: 每隔 2-3 分钟检查最后一条消息 如果最近 3 条都是自动回复,就自动暂停 避免它们半夜自己聊到停不下来。 --- 这个“茶水间”的价值不在于直接创造业务收益,而在于一种潜移默化的系统人格塑造。 它不强调自己的存在, 却在悄悄维持 Agent团队的凝聚力、性格关系和健康状态。 你几乎感觉不到它, 但系统会因为它,变得更像一个“活着的团队”。 --- 在记忆层设计上,我最后没有引入向量数据库,而是继续深度定制 SQLite。 不是因为技术保守,而是因为工程决策必须在约束条件下做权衡。 对桌面应用来说,多一个依赖,就多一个故障点、多一个安全风险面、多一个打包负担。 结果是: >几张SQLite表 >动态表名 >结构化JSON字段 就支撑起了3个乃至更多Agent的独立记忆系统。 --- 这套记忆系统现在已经形成了一条完整链路: 短期对话记忆(20条) -> 长期反思笔记(6小时一次) -> 结构化 JSON 记录 而我还在继续推进8个方向: ➤上下文延续 ➤记忆结构化 ➤记忆驱动行为 ➤心理学三类长期记忆 ➤团队协作记忆 ➤动态进化记忆 ➤知识图谱记忆 ➤记忆压缩与高效检索 我的目标,不是让Agent记住你说过什么 而是让它从记住你说过什么的工具,慢慢进化成能理解你、预测你、协同你的长期伙伴 GitHub: 作者:Powerpei(萧楠)

Powerpei

227,448 görüntüleme • 4 ay önce

AI 每天都在干活,最后为什么只长了数据库? 现在做 Agent,很容易产生一种虚假的繁荣。 日志越来越多,向量库越来越大,接入的工具越来越全,工作流也越来越复杂。 系统看起来什么都留下了。 可下一项相似任务到来时,模型的判断未必比上一次更好。 这就像一个员工每天写十页工作日报。年底一看,硬盘写满了,脑子还停在年初。 存得更多,不等于学得更多。 今天很多 AI 缺的不是第二块硬盘,而是一条能把真实工作变成模型能力的路。 我更愿意把它叫作:能力复利。 工具解决的是“这一次能不能完成”;能力复利解决的是“这一次完成之后,下一次能不能更好”。 这件事必须从完整的工作现场开始。 客户之前说过什么,项目为什么这样决策,哪些方案被否决,谁修改了结果,最终反馈发生在什么时间——如果这些信息散落在邮件、会议、文档和聊天记录里,模型看到的就只是几个孤立碎片。 Alloomi 的 Holistic Context,试图把分散的信息重新组织成一个持续变化的业务世界。 在验证跨会话问答、时间关系和多跳推理的 LoCoMo‑V2 上,取得 97.4%,对照 Mem0‑V3 的 92.5%。 在验证长期信息提取、知识更新和多会话综合推理的 LongMemEval‑S 上,取得 97.6%,对照 Mem0‑V3 的 94.4%;该项公开人类参考为 82.9%。 在千万 Token 历史规模下测试全局理解与信息定位的 BEAM 10M 上,取得 67.0%,对照 Hindsight 的 64.1%。 这些数据背后真正重要的,不是给 AI 增加一个更大的记忆库。 而是让它理解一件事情为什么发生、怎样变化,又是如何走到最终结果的。 当工作现场被完整还原,真正困难的部分才刚刚开始: 这些经历,能不能改变模型下一次的判断? 一次真实任务会留下 Context、Decision 和 Feedback:模型当时看见了什么、做出了什么选择、最后获得了怎样的反馈。 但并不是所有轨迹都值得学习。 错误判断、偶然成功和低质量反馈如果直接进入训练,模型不但不会进化,反而可能把错误放大。 所以 Alloomi 的 Self‑Evolving Agent 会先进行质量筛选和专家锚定,再通过 Online LoRA、跨任务回放与能力蒸馏,把有效经验逐步写入模型。 在验证从复杂上下文中学习新规则并用于后续执行的 CL‑Bench 上,SEA 取得 47.6%,同基座参考为21.5%。 在验证长周期、多阶段经验积累与迁移的 CL‑Bench‑Life 上,取得 32.1%,公开榜单中的 GPT 5.5(High)为22.2%。 在验证跨任务持续学习、环境适应和抗遗忘的 Con.L Bench 上,取得 32.6%,对照 Claude Sonnet 4.6 的22.3%。 跨模型成绩更适合观察公开榜单位置。真正能够判断框架贡献的,仍然是相同基座和相同评测条件下,21.5% 到47.6%的变化。 因为数据库保存的是“曾经发生过什么”。 训练改变的是“以后遇到类似问题会怎么做”。 但能力进入模型,还不能算完成。 最后仍然要回到现实世界,接受一个很朴素的检查: 代码修好了吗?报告能交吗?复杂任务形成了可以验收的结果吗? 在覆盖高经济价值职业任务的 GDPval‑AA Normalized 上,Alloomi 取得 74.2%,对照 Claude Opus 5 的67.9%。 在验证真实职业工作流与专业交付的 JobBench 上,取得57.5%,报告列出的公开参考为54.7%。 在验证真实 GitHub 问题修复、连续软件工程经验迁移和抗遗忘能力的 SWE‑Bench‑CL 上,取得80.6%,对照 OpenCode、Kimi K3 与 FAISS 组合方案的73.3%。 从真实工作进入上下文,从任务反馈进入训练,再从模型能力回到专业交付,这才构成一条完整的成长路径: 真实任务轨迹 → 质量筛选 → 专家锚定 → 后训练 → 评测准入 → 版本回滚。 效果变好,新的能力才能进入下一版本;如果更新破坏了旧能力,系统就回滚。 所以,自进化不是让模型随意修改自己。 而是让它在可验证、可审计、可撤销的条件下持续成长。 过去我们看 Agent,喜欢看第一次 Demo 有多惊艳。 但 Demo 看的是峰值,长期工作看的是斜率。 真正值得观察的,不是它今天执行了多少任务,而是这些任务有没有让能力曲线继续向上。 工具的价值,是帮 AI 做完一件事。 自进化的价值,是让这件事没有白做。 这就是 Alloomi 想建立的能力复利: 让 AI 每完成一次交付,就获得一次成长。 AlloomiAI

知识猫AI实验室

12,802 görüntüleme • 1 ay önce