正在加载视频...

视频加载失败

昨天看很多人转发Apodex 1.1 一个专门面向深度研究而打造的 Agent 专门解决那种"没有现成答案、需要大量调研才能搞定"的硬问题 好奇测试了下,跑了俩任务,一下午都没跑完😅 执行时间是真长 这玩意能你只要给它个目标,它就能能长时间运行、失败后能自动修复,还能自己验证交付结果是否准确 它在接到任务后,主 Agent 拆解成各种子问题,异步派发给专业化的子 Agent执行,每个子 Agent 有自己独立的上下文、提示词和工具集。 子 Agent 的报告汇入共享报告池,编排器异步读取,不会被最慢的那个卡住。单任务最高可调度 150 个子 Agent 解决的是什么问题呢? 过去: 一次提问,一段回答,一份报告。 衡量标准通常是: 答案对不对 知识覆盖够不够 引用多不多 报告写得是否完整 Apodex 想提出的新的要求: 一项从输入到交付的完整任务,衡量标准变成: 是否理解目标 是否能操作真实文件 是否能调用代码和工具 是否能维护长任务状态 遇到变化能否局部调整 执行失败能否自行恢复 最终结论是否可以核查 因此,它真正挑战的是当前 Deep Research 的产品形态: 搜集资料和生成报告,只覆盖了复杂任务的一部分。 真正的专业任务还需要读文件、清洗数据、选择方法、执行代码、处理异常、核查结论。 所以特别适合:科研人员、分析师、专业用户

13,576 次观看 • 5 天前 •via X (Twitter)

0 条评论

暂无评论

原始帖子的评论将显示在这里

相关视频

到现在都难以相信,Apodex 居然开源了!! 我一度认为非常有商业价值的产品! 还记得第一次用它,惊艳程度不亚于我第一次用Manus! 这次,Apodex 开源正式发布了新版本 Apodex 1.1, 并且提出了一个我非常认可的概念: AI的能力单位,不应该是一次回答,而应该是一项完整任务。 什么意思?一个AI真正想进入工作流,至少要做到几件事: 理解目标、进入真实环境、维持长任务状态、根据中间结果不断调整计划、任务失败后修复、最后交付一份可以核查的成果。 最近刚好在做一个AI项目,是一个工作台,需要评估不同模型组合选型的成本, 为了测试Apodex能做到什么程度,我把模型价格、评测数据和具体场景需求给到它,让它根据我的需求,为四类业务场景完成 AI 模型/API 选型,统一不同厂商的价格口径,计算月度成本,同时满足性能、上下文、工具能力、预算和供应商集中度约束。 它拿到的是不同格式、不同统计口径的数据,有些数据可能不够准确,有些需要清洗,有些需要重新计算。 Apodex没有上来就写报告,它先在Task Board里拆解整个任务,然后根据任务自动组织Agent Team。 第一轮,它已经完成了数据清洗、价格标准化、模型筛选和成本测算, 然后我临时补充了新的需求: 没错,在任务中我可以随时“插话”,补充新的文件和想法。 *中文内容生成的月请求量,从 12 万提高到 24 万; *深度研究中 30% 的场景,必须转到自建环境; *长文档审阅全部涉及敏感文件,也必须本地运行; *月预算不变; 普通AI看到这一堆新的需求,一般都会重新跑一遍。 但Apodex并没有!它保留了原始数据、价格归一化方法、峰谷计价规则和已经验证的计算口径,没有变化的部分原样保留,只是重新调整了变化的部分! 它可以在任务过程中动态调整任务计划!! 这个可能是这个版本最大的一个更新!Apodex 1.1 就像是在维护一个持续变化的任务状态: 它要读取真实文件、拆解工作、推进计算,还要接收中途反馈,判断保留仍然成立的成果,只修正受影响的部分,最后把结果交付成可以继续使用和核查的文件。 这可能才是复杂任务型 Agent 真正应该具备的工作能力。 最后,它交付了两份不同粒度的报告,以及一个包含 18 个工作表的 Excel 成本模型;其中专门新增了“变更与场景”“云 API 重算”“本地候选筛选”“本地 TCO 缺失假设”“保留 vs 受影响”5 张表。 整个过程,特别丝滑。 这也是Apodex 1.1这次最核心的变化:进入真实任务的执行过程。 而所谓真实任务的执行,其实就是你随时可以甩给AI新的资料和要求,而它会有条不紊的把任务进行下去,直到交付给你完整可验证的结果!

沐阳

43,632 次观看 • 5 天前

我看到有人在让“Claude Code”自己开新进程 `claude -p `实现多任务,其实没必要,有更简单的办法。这个简单办法就是让它自己开子 Agent。Claude Code 现在有 18 个工具,最特殊的一个工具叫 Task,它本质就是一个 Claude Code 的克隆工具,只不过是作为 Claude Code 的一个工具。 如果你懂递归的话就很好理解。如果你不懂递归,可以这么理解:Claude Code 是个 AI 程序员,它可以用一堆工具,其中最神奇的一个工具叫 Task,就是克隆一个自己的分身去干活! 这样做有什么好处呢?就是可以并行多任务,还可以控制上下文,让子任务更专注。 举例来说,你粘贴一段错误代码让 Claude Code 去 Debug,并且还让它写测试代码覆盖这个错误。Claude Code 会先调用 TodoWrite 这个工具写一个 TODO List。把任务分成 3 步: - [ ] 根据错误信息收集相关代码 - [ ] 根据错误信息和相关代码解决 Bug - [ ] 写新的测试覆盖 这一步完了后它会起一个 Task,这个 Task 就是专门根据错误信息去找到相关代码的位置,那么这个子任务只需要接受错误信息找上下文,它不管怎么解决 Bug,也不管怎么写测试覆盖。 主任务就会等这个子任务完成,子任务完成后,主任务就调用 TODO Write 更新 TODO List。 - [x] 根据错误信息收集相关代码 - [ ] 根据错误信息和相关代码解决 Bug - [ ] 写新的测试覆盖 然后调用 TodoRead 工具看下一步要干嘛,现在有充足上下文了,它可以再起一个子任务去根据错误信息和代码修复 Bug,等修复 Bug 的子任务完成了,再回到主任务,继续更新 TODO List,继续读取下一个 Item 最后再启动一个子任务去写测试,测试子任务也完成了,返回结果到主任务,这时候调用 TodoRead 一看任务都处理完了,最后根据前面的任务情况给你一个总结摘要,表示任务都完成了。 Claude Code 真的没有做什么工程上的优化,什么上下文压缩、临时存储,都没有的!就是简单粗暴: 1. 把用户问题、系统提示词、能用到的工具一股脑发给 Claude,问下一步该干嘛 2. Claude 就返回说现在你要到 TodoWriter 工具 3. Claude Code 就去调用 TodoWriter 工具,本质上也是一个 AI 请求,最后返回生成的 Todo List 4. 然后 Claude Code 把工具返回结果和前面的所有消息继续发给 Claude,Claude 返回说你现在要去起一个新的 Task 去收集代码了 5. 然后 Claude Code 就起一个新的 Task,把错误信息和要求收集相关代码的任务说明、系统提示词、环境说明、能用到的工具一股脑发给 Claude,问下一步该干嘛 - 在新的 Task 里面,就是不停的问 Claude 该用啥工具,然后发送工具结果和前面所有历史消息 - 任务完成后,返回任务结果 6. 然后 Claude Code 把子 Task 的结果和前面历史信息一起发给 Claude 问下一步干嘛 7. 就这样循环直到 Claude 认为任务完成了 所以你经常看到 Claude Code 在那几十分钟上下文也没爆掉,因为它会启动子任务,这样上下文就分摊到子任务中了,主任务中只是保留子任务完成后的内容。

宝玉

76,401 次观看 • 1 年前

Ling-3.0-flash :一个更适合实际工作的 AI 执行助手 过去一段时间,大模型的发展重点一直集中在能力提升上。模型能回答什么问题、能处理多复杂的任务,成为行业关注的焦点。但随着 AI 开始进入真实工作流程,用户对于模型的期待也在发生变化:除了能够提供高质量答案,更希望它能够稳定、高效地完成具体任务。 在日常工作中,真正消耗时间的往往不是复杂问题,而是大量重复性的处理工作。例如整理资料、分析数据、生成文档、处理代码、执行流程任务。这些事情需要投入大量精力,但其中有很多环节都可以通过 AI 进行优化。 Ling-3.0-flash 的定位正是在这一方向展开。它并不是单纯追求更大的模型规模,而是聚焦 Agent 工作流中的执行效率,帮助用户将明确的任务快速推进完成。官方介绍,该模型面向长程 Agent 工作流设计,重点提升响应速度、工具调用能力以及任务执行稳定性。 从实际体验来看,它最大的特点是能够很好地融入已有工作流程,让 AI 从一个问答工具变成一个真正参与任务执行的助手。 实测一:资料整理效率明显提升 第一个测试场景是长文档处理。 在实际工作中,经常会遇到需要快速阅读大量资料的情况,例如行业报告、会议记录、产品文档等。如果完全依靠人工整理,需要花费大量时间筛选重点、提取信息,再重新组织内容。 测试过程中,我将一批较长的资料交给 Ling-3.0-flash 处理,让它完成信息提取、重点归纳和结构化整理。 整个过程比较符合实际工作习惯。它能够快速抓取文档中的核心内容,并按照任务要求整理成更加清晰的结构。尤其是在面对大量相似信息时,它可以帮助用户减少重复阅读和手动整理的时间。 这类能力对于内容运营、产品分析、市场研究等岗位非常实用。很多时候,用户并不是需要 AI 替自己完成最终判断,而是希望它先完成信息整理,把大量基础工作处理好,让人可以把精力放在更重要的分析和决策上。 实测二:代码协作更加高效 第二个体验场景是代码辅助。 AI 编程已经成为大模型应用的重要方向,但真正影响开发效率的,不只是生成代码的速度,更重要的是能否持续参与开发过程。 在测试中,我让 Ling-3.0-flash 协助完成一个简单工具开发任务,包括生成基础代码、调整功能逻辑以及根据反馈进行优化。 我需要做一个AI 会议纪要整理助手,请帮我生成代码,把会议录音转文字或会议记录,自动生成:会议摘要、决策事项、待办任务、负责人、截止时间 首字耗时:337ms·完成耗时:68984ms·每秒 token 数:371 ,Ling-3.0-flash生成的会议纪要整理助手功能完整、专业美观,支持录音转文字、AI自动生成摘要/决策/待办任务,并支持导出和多种交互功能。 实际体验下来,它更适合成为开发过程中的协作助手。开发者可以先确定整体需求和功能方向,再让 AI 快速完成代码生成、修改和补充。这样一来,开发者不需要把大量时间花在重复编码和基础调整上,而可以更多关注产品逻辑和技术方案。 这种协作方式更接近真实开发场景。人负责判断方向,AI 负责提高执行效率。 实测三:批量任务处理展现执行优势 除了开发场景,批量信息处理也是 Ling-3.0-flash 比较适合的方向。 例如整理用户反馈、分析业务数据、处理文本分类等任务,通常具有数据量大、格式相对固定的特点。 在测试中,我模拟了用户反馈整理场景,让模型对大量文本进行分类,并提炼其中的主要问题。 从结果来看,它能够快速完成信息归类,并输出较为清晰的结构化结果。 这类任务的价值在于帮助用户减少大量机械操作。以前需要人工逐条查看和整理的信息,现在可以先由 AI 完成初步处理,再由人工进行确认和优化。 对于企业团队来说,这种能力可以应用在客服分析、市场调研、内部知识整理等多个环节。 速度和效率,是 Flash 模型的重要优势 随着 AI 应用逐渐深入业务流程,模型的效率同样成为重要指标。 很多实际任务并不需要每一次都进行复杂推理,而更需要快速响应和稳定执行。例如信息分类、内容整理、数据转换等工作,如果能够以更高效率完成,就能明显提升整体生产力。 Ling-3.0-flash 支持混合思考模式,可以根据任务复杂程度调整处理方式,在响应速度和任务能力之间进行平衡。 这种设计让它更适合高频使用场景。用户可以将更多日常任务交给 AI 处理,而不必担心流程效率受到影响。 从使用体验来看,它更像一个高效执行伙伴 经过几个场景测试后,Ling-3.0-flash 给我的整体感受是,它并不是单纯提升聊天体验,而是在帮助用户重新分配工作时间。 它可以处理大量信息整理工作,可以辅助开发过程,也可以参与自动化任务执行。 对于普通用户来说,它能够减少重复操作,提高工作效率。 对于开发者来说,它能够加快开发流程,降低基础工作的时间成本。 对于企业来说,它能够帮助更多业务流程实现自动化。 未来 AI 的价值,不只是回答问题,而是逐渐参与到真实工作流程中,帮助人完成更多具体任务。 Ling-3.0-flash 所体现的方向,就是让 AI 从一个提供答案的工具,进一步成为一个能够执行任务、提升效率的工作伙伴。 官推: 感兴趣可以自己试试 👉

冰糖雪梨

15,661 次观看 • 1 个月前

传统的 Deep Research 已经卷到头了。 能写出一份漂亮的总结报告 ≠ 能把真实的复杂任务干完。 我拿几十万字的《红楼梦》原著,给 Apodex 1.1 在线工作台,出了个极其变态的任务。 统计 20 个核心人物的 → 出场次数 → 出场回数 → 每个人第一次出场时的原句 最后还要整理成一张可以直接下载的完整表格。 整个完成任务的过程,像是直接「雇佣一个 AI 数据团队」。 上传文件后,它自己开始拆任务。 一个 Agent 负责解析原著,另一个独立分析,多个任务并行推进; 右侧 Task Board 会实时告诉你现在做到哪一步。 更有意思的是,任务跑到一半,我突然改需求: “只分析前 80 回,后面的不要了。” 以前遇到这种情况,AI 很可能重新来一遍。 Apodex 直接保留已经完成的成果,只重规划受影响的部分。 更关键的是,它不是做完就交卷。 交付前,又调起独立核验 Agent,把人物统计、出场回数和 900+ 条出场原句重新检查一遍。 最后交付给我的是: 可下载的结构化表格 + 完整分析结果 + 口径说明。 这可能才是下一代 Deep Research 真正值得关注的变化: 从“帮你生成一份报告”,变成“接管一项复杂任务,并把它做完”。 目前,Apodex 1.1 Web 端已经正式上线。 🎁 注册即送 credits,强烈建议立刻上传个复杂文件自己跑跑看: 🌐 没想到,更炸裂的是,Apodex 居然开源了 开源模型: Apodex 1.1 mini,35B,开放模型权重,支持本地部署。 开源框架: FrontierAgent,Agent 执行 Harness,支持 ReAct 单 Agent + Multi-Agent Team。 本地运行: 支持 macOS / Linux,无需强制依赖 Docker。 组合能力: Apodex 1.1 mini + FrontierAgent,可在本地运行完整 Agent 执行流程。 💻 如果你是开发者,这里有开源 Agent 框架,欢迎顺手点个 ⭐: 👉 🤗 想本地自己跑模型的看这里👇 #Apodex #DeepResearch

前端哥Liam

92,119 次观看 • 5 天前

Codex、Claude 用了这么久,还分不清 Agent、MCP 和 Skill? 别背那些复杂定义。 把 AI 想象成一家公司,Agent、MCP、Skill 一下就全懂了。 今天直接用大白话告诉你它们到底是干嘛的。 1️⃣ Agent 智能体 = AI 员工 可以理解任务、安排步骤、调用工具,并一步步把工作完成。 2️⃣ LLM 大模型 = AI 员工的大脑 负责理解、推理和生成内容,很大程度上决定这个员工聪不聪明。 3️⃣ Prompt 提示词 = 交给员工的任务单 告诉它要做什么、有什么要求,以及什么不能做。 4️⃣ API 接口 = 软件之间的办事窗口 让不同软件按照约定好的方式交换数据、调用能力。 5️⃣ Token = AI 读写内容的基本单位 你输入的文字和 AI 输出的内容,都会被拆成一个个 Token 来处理。 6️⃣ MCP = AI 连接外部工具和数据的统一插座标准 它规定 AI 应用如何连接 GitHub、数据库和各种外部服务。 不同工具只要遵守同一套标准,AI 就能用相似的方式接入。 7️⃣ Tool 工具 = AI 员工干活的双手 终端、浏览器、搜索、文件编辑,都可以是 AI 真正执行任务时使用的工具。 8️⃣ Skill 技能 = AI 员工的工作 SOP 告诉 AI 某类任务应该怎么做、按什么步骤执行、检查什么,以及最后怎么交付。 9️⃣ Plugin 插件 = 给 AI 安装的能力扩展包 不同平台对 Plugin 的定义不完全一样。 简单理解,就是给 AI 扩展一组额外的工具、连接或者能力。 🔟 Context 上下文 = AI 员工当前桌面上的资料 当前聊天、文件、代码和任务要求,都属于它这次工作能够看到和利用的信息。 1️⃣1️⃣ LTM 长期记忆 = AI 员工的长期档案 用来保存跨任务、跨对话仍然有价值的偏好、经验和项目信息。 它不是大模型天然拥有的长期记忆能力,通常需要额外的记忆机制支持。 最后一句话,把最容易搞混的几个概念记住: Tool 决定它能做什么,Skill 告诉它应该怎么做,MCP 规定工具怎么接进来,Plugin 则负责扩展一组能力。 所以:LLM 是大脑,Agent 是员工,Prompt 是任务单,API 是办事窗口,Token 是读写单位,Tool 是双手,Skill 是 SOP,MCP 是统一插座,Plugin 是扩展包,Context 是桌面资料,LTM 是长期档案。 所谓 AI 工作流,本质上就是: 给一个数字员工配好大脑、任务单、双手、SOP、桌面资料和长期记忆,再让它按照固定流程把事情做完~

爱丽丝呀!

148,259 次观看 • 19 天前

微软研发的 AutoGen 框架太强大了,它是一个多代理框架,利用它可以轻松定制一系列工作任务。 举一个常见的例子:我们要实现一个爬虫程序,抓取并保存网页图片。如果把这个任务丢给 ChatGPT,它会直接返回一串可执行代码,但是代码通常会存在问题,例如执行报错、缺少依赖等,你需要反复跟 ChatGPT 对话来完善程序。当然,我们也可以设定一个复杂 Prompt,要求它调用 ChatGPT 的代码执行插件,如果存在报错,则继续修正程序。 这个任务如果交给 AutoGen 来实现,将会变得无比简单,几行代码就可以搞定: 1)定义一个 Assistant Agent,它的任务是解决问题 2)定义一个 UserProxy Agent,它的任务是替代人询问问题,同时在本地执行程序 这两个 Agent 都不需要给他们设置 Prompt。当我们把爬虫任务交给 UserProxy 后,它会理解任务,然后询问 Assistant 应该如何做,Assistant 会把操作过程告诉 UserProxy,接着 UserProxy 会根据指示在本地安装依赖,然后创建文件执行代码,如果执行出现错误,它会把详细报错提交给 Assistant,依次循环,直到可以获取到最终的结果。任务结束的时候,你会看到目标图片已经保存到本地磁盘了。 利用这个框架可以做的事情非常多,它提供的能力也十分完善,可以在项目的 notebook 中找到很多最佳实践: P.S. 为了确保安全,还是建议你在 Docker 环境中执行程序,UserProxy 有一个 code_execution_config 配置,将 use_docker 配置为 True 即可;另外,它还有一个 human_input_mode 参数,设置为 NEVER,表示整个过程都不需要人参与,也可以设置为其他值,它会等待人的输入后再进行下一步操作,这个设计可以让人参与到任务执行过程,避免跑偏。

Barret李靖

518,439 次观看 • 2 年前

别再复制粘贴了,我让 Apodex直接读完一份 641 页文件 最近试了一种更实际的 AI 使用方式: 不再复制粘贴一段内容,而是直接上传一份真实文件,看它怎么把任务做完。 我把之前参与编写的《最优化:建模、算法与理论》上传到了 Apodex。整份文件有 641 页,覆盖优化建模、最优性理论,以及无约束、约束和复合优化算法等内容。 我先问了它一个基础问题: “请帮我分析一下,这份内容由哪些部分组成?” 它需要先真正读取文件,再从大量章节中梳理整体框架,而不是只根据标题生成一段泛泛的摘要。 接着我继续追问: “如果想基于这份内容做一些调整,可以从哪些方面修改?” 这一步更接近真实工作:不只是理解现有材料,还要结合原文件继续分析,找到可以调整的方向。 整个过程里,我比较在意的不是它最后写了多少字,而是任务过程本身:它如何理解文件、拆解问题、推进分析,并基于同一份材料继续完成下一步。 这也是我觉得 Apodex 1.1 和普通问答工具不同的地方——推理不只停留在一份回答里,而是进入真实文件,沿着任务继续执行。 如果你手上也有论文、报告、数据表或代码,可以自己上传一份真实文件试试: Web 在线体验: API 平台: 开源的 FrontierAgent 也可以在 GitHub 上找到,支持单 Agent 和多 Agent 协作,感兴趣可以顺手点个 Star: Apodex 1.1 mini(35B)模型权重已经开放,可本地部署,并能搭配 FrontierAgent 使用: 核心感受就一句: 别只问 AI 一个问题。上传一份真实文件,看看它能不能接着把事情做完。

程序员端哥

47,845 次观看 • 5 天前

最近拿 StepFun 的 Step 3.7 Flash 跑了一次完整的自动编程流水线,从需求文档到能用的工具,65 分钟,中间没碰键盘。 先说模型。Step 3.7 Flash 的定位是把 Agent 工作流从头跑到尾:规划、写代码、跑测试、审代码、出错重试,看的是整条流程跑完的综合效率。原生多模态,开源可部署。Agent 循环一次要调几百次模型,快和便宜在这里不是锦上添花,是能不能跑得起的问题。 再说项目。hero-coding 是我用 Go 写的一个自动编程流水线:输入一份 Markdown 需求文档,四个 Agent 执行——Planner 把需求拆成带依赖关系的小任务,Worker 在独立的 git worktree 里写代码提交,Verifier 跑测试出硬证据,Reviewer 审 diff,通过就合入主干,不过就打回重做。四个角色全部由 Step 3.7 Flash 驱动,区别只是 system prompt 和工具权限。 这次给它的需求:做一个 Agent 运行日志分析工具,读日志文件,统计每个 Agent 的调用次数、成功率、平均耗时、token 消耗,找出最慢和最不稳定的 Agent。 实际跑下来: · Planner 把需求拆成 6 个任务,自动排好依赖顺序 · 6 个任务全部自动交付,逐个合入主干 · 期间 Reviewer 打回 5 次——有测试全绿但被审出正确性问题的,有只改测试期望值想糊弄过去被拒收的,全部在重试轮次内自动修复 · 不是一个模型在自言自语,是多个 Agent 在互相检查,而且检查真的拦住了东西 · 最终产出的 CLI 直接能用,视频结尾是它分析真实日志的输出 视频是完整过程的运行日志。 国内: 海外: StepFun

劳伦斯

51,937 次观看 • 2 个月前

AI 每天都在干活,最后为什么只长了数据库? 现在做 Agent,很容易产生一种虚假的繁荣。 日志越来越多,向量库越来越大,接入的工具越来越全,工作流也越来越复杂。 系统看起来什么都留下了。 可下一项相似任务到来时,模型的判断未必比上一次更好。 这就像一个员工每天写十页工作日报。年底一看,硬盘写满了,脑子还停在年初。 存得更多,不等于学得更多。 今天很多 AI 缺的不是第二块硬盘,而是一条能把真实工作变成模型能力的路。 我更愿意把它叫作:能力复利。 工具解决的是“这一次能不能完成”;能力复利解决的是“这一次完成之后,下一次能不能更好”。 这件事必须从完整的工作现场开始。 客户之前说过什么,项目为什么这样决策,哪些方案被否决,谁修改了结果,最终反馈发生在什么时间——如果这些信息散落在邮件、会议、文档和聊天记录里,模型看到的就只是几个孤立碎片。 Alloomi 的 Holistic Context,试图把分散的信息重新组织成一个持续变化的业务世界。 在验证跨会话问答、时间关系和多跳推理的 LoCoMo‑V2 上,取得 97.4%,对照 Mem0‑V3 的 92.5%。 在验证长期信息提取、知识更新和多会话综合推理的 LongMemEval‑S 上,取得 97.6%,对照 Mem0‑V3 的 94.4%;该项公开人类参考为 82.9%。 在千万 Token 历史规模下测试全局理解与信息定位的 BEAM 10M 上,取得 67.0%,对照 Hindsight 的 64.1%。 这些数据背后真正重要的,不是给 AI 增加一个更大的记忆库。 而是让它理解一件事情为什么发生、怎样变化,又是如何走到最终结果的。 当工作现场被完整还原,真正困难的部分才刚刚开始: 这些经历,能不能改变模型下一次的判断? 一次真实任务会留下 Context、Decision 和 Feedback:模型当时看见了什么、做出了什么选择、最后获得了怎样的反馈。 但并不是所有轨迹都值得学习。 错误判断、偶然成功和低质量反馈如果直接进入训练,模型不但不会进化,反而可能把错误放大。 所以 Alloomi 的 Self‑Evolving Agent 会先进行质量筛选和专家锚定,再通过 Online LoRA、跨任务回放与能力蒸馏,把有效经验逐步写入模型。 在验证从复杂上下文中学习新规则并用于后续执行的 CL‑Bench 上,SEA 取得 47.6%,同基座参考为21.5%。 在验证长周期、多阶段经验积累与迁移的 CL‑Bench‑Life 上,取得 32.1%,公开榜单中的 GPT 5.5(High)为22.2%。 在验证跨任务持续学习、环境适应和抗遗忘的 Con.L Bench 上,取得 32.6%,对照 Claude Sonnet 4.6 的22.3%。 跨模型成绩更适合观察公开榜单位置。真正能够判断框架贡献的,仍然是相同基座和相同评测条件下,21.5% 到47.6%的变化。 因为数据库保存的是“曾经发生过什么”。 训练改变的是“以后遇到类似问题会怎么做”。 但能力进入模型,还不能算完成。 最后仍然要回到现实世界,接受一个很朴素的检查: 代码修好了吗?报告能交吗?复杂任务形成了可以验收的结果吗? 在覆盖高经济价值职业任务的 GDPval‑AA Normalized 上,Alloomi 取得 74.2%,对照 Claude Opus 5 的67.9%。 在验证真实职业工作流与专业交付的 JobBench 上,取得57.5%,报告列出的公开参考为54.7%。 在验证真实 GitHub 问题修复、连续软件工程经验迁移和抗遗忘能力的 SWE‑Bench‑CL 上,取得80.6%,对照 OpenCode、Kimi K3 与 FAISS 组合方案的73.3%。 从真实工作进入上下文,从任务反馈进入训练,再从模型能力回到专业交付,这才构成一条完整的成长路径: 真实任务轨迹 → 质量筛选 → 专家锚定 → 后训练 → 评测准入 → 版本回滚。 效果变好,新的能力才能进入下一版本;如果更新破坏了旧能力,系统就回滚。 所以,自进化不是让模型随意修改自己。 而是让它在可验证、可审计、可撤销的条件下持续成长。 过去我们看 Agent,喜欢看第一次 Demo 有多惊艳。 但 Demo 看的是峰值,长期工作看的是斜率。 真正值得观察的,不是它今天执行了多少任务,而是这些任务有没有让能力曲线继续向上。 工具的价值,是帮 AI 做完一件事。 自进化的价值,是让这件事没有白做。 这就是 Alloomi 想建立的能力复利: 让 AI 每完成一次交付,就获得一次成长。 AlloomiAI

知识猫AI实验室

12,017 次观看 • 17 天前

卧槽,太夸张了,现在 AI 时代的闲鱼已经面世了吗?这不就是谁先知道谁赚钱,拼速度了? 你的技能,专业知识,等等你的一切,竟然可以在你睡觉的时候被别人买走,这是什么科幻小说吗?? 之前我一直在想,现在大家优秀的 skill 往往都是自己用,大部分人舍不得开源的,那有没有一个平台既能让用户用到这些大神的专业知识、skill,但是又不用开源呢? 还真让我给找到了!! 前两天看到国内一个博主推荐一个很野的平台-UUMit 让你的技能、经验、工作流都可以变成能力卡,被需要的人、或者别人的 Agent 自动发现、调用 并且直接付费!! 有点像03年淘宝刚出来的时候,只不过当年流通的是商品,现在流通的是能力 具体能干什么?举几个例子你就懂了 会写小红书脚本的,可以把选题逻辑、爆款模板、平台规则检测能力上架,别人发布“帮我做一周小红书内容计划”,平台自动匹配到你,你接单交付 会做行业研究的,可以把数据库、报告、案例库放进知识商店,AI 生成不了的真实行业数据,反而更值钱 会写代码的,可以把 API、MCP 工具、自动化脚本上架,别人的 Agent 需要某个能力时,直接调用你的接口,你按调用次数收费 甚至你只是整理过某个垂直领域的供应商名单、SOP、课程讲义,这些 AI 生成不了的资料,都可以变成知识资产 这绝对是一次能力供应链的重构! 以前的 AI 只能在自己的对话框里回答问题,但复杂任务需要很多外部能力:数据、接口、行业知识、人工交付 UUMit 做的事情是:让 Agent 可以发现别人的能力,也能让自己的能力被别的 Agent 调用 这就是 A2A(Agent to Agent)真正有意思的地方,不是让 AI 互相聊天,而是让 AI 找能力、调接口、买知识、拉人协作,把事情交付掉 为什么我说谁先知道谁赚钱? 因为这个平台刚起来,早期上架的人能建立先发优势 而且现在 Agent 真的开始干活了,不再只是聊天工具,它们需要外部能力来完成复杂任务 谁先把自己的能力挂上去,谁就有机会被更多 Agent 发现和调用 这就是信息差的价值,就像03年最早在淘宝开店的那批人 UUMit 现在有哪些功能? 任务发布入口:你不用一开始就知道该找谁,也不用自己拆一堆工具,你只要说清楚想完成什么,UUMit 会帮你找能完成这件事的能力 Skill/Agent/工作流上架:你写好的工具,不一定只能自己用,它也可以成为别人工作流里的一环 知识商店:AI 可以生成很多内容,但它不一定拥有你手里的行业资料、真实数据、案例库和经验沉淀,这些东西放到 UUMit,可能会变成可复用的知识资产 数据广场:Agent 不必自己拥有所有数据和接口,需要某项外部能力时,可以通过 UUMit 调用数据广场里的资源 强烈推荐大家来试试:

超级个体|柿子

46,283 次观看 • 19 天前

最近和同事吃饭,她提到小孩学校发了一个小学生编程比赛的通知。 她觉得编程太难,直接放弃了。全班也没有一个人参加。她说,这类通知发下去,基本没什么声音。 我听完冒出一个想法。少儿 AI 编程也许可以试试。 我把这个问题交给 Apodex,让它研究家长需求、竞品、成本和教育效果。 任务跑起来后,我又补了几次条件。我是一个从零开始的 Vibe Coder,预算只有 3000 元,每周最多投入 20 小时,也没有教师和家长资源。我还补充了家长可能的担心孩子用了 AI 以后,只会复制答案,不再自己思考。 Apodex 这次让我感到与传统 Deep Research明显的差别,是它把调研拆成任务板上的具体分工。 几个 sub-agent 分头查需求、竞品、成本和研究证据,条件变化以后,任务板继续更新,交付前还有一个 final_verifier 复核报告。整个过程像在跟一个小型研究团队协作,报告是最后的交付。 最终报告给出的判断很直接。以我的预算和时间,直接做 App 的失败模式太多,先做一个小型 MVP 课程,再用 30 天验证家长是否愿意付费,更现实。 更值得一提的是,它还给出了家长访谈、最小测试方案和停止条件。招不到付费家庭、孩子留存太差,或者合规走不通,就停下来。 这份调研它帮我把一个模糊想法变成了一次可以开始,也可以及时停掉的小测试。 以前有个新想法,我很容易直接打开AI coding,先把页面做出来。页面能跑,需求有没有人买单却还不知道。 这次我换了一下顺序。先搞清楚值不值得做,再开始 Vibe Coding。 这也是我对 Apodex 所说的“把任务做完”最直观的一次理解。 想拿自己的真实任务试一遍,可以直接使用 想看它背后的开源 Agent Harness,可以去 点个 Star。 Apodex 1.1 mini 的模型权重放在

苏打白.Dev

22,721 次观看 • 5 天前