Loading video...

Video Failed to Load

Go Home

硅谷的Party真不少。不是吃喝玩乐的party, 是技术碰撞分享的聚会。 这不, Andrej Karpathy在另一场小型聚会上分享了他这几年和Agent的经验。 Karpathy 主要讲了四点: 1. 2016 年 OpenAI 做 agent 太早了 当时他们试图用强化学习做能操作电脑、点网页、完成任务的 agent,项目叫 World of Bits。但技术栈不成熟,基本只能靠 RL 去“撞 reward”,所以效果不好。 2. 当时正确路线是先做语言模型 他认为后来事实证明,先放下 agent,转去构建 language model 是对的。今天 agent 重新变热,是因为底层工具已经完全不同:现在不是靠 RL 硬训,而是靠语言模型、工具调用、记忆、规划等能力组合。 3. Agent 很容易 demo,但很难产品化 他提醒大家不要被 demo 迷惑。自动驾驶、VR 都是类似例子:想象很容易,做 demo 也容易,但真正做成可靠产品可能需要十年。Agent 也是这样,适合长期投入,不适合短期幻想。 4. Agent 需要借鉴人类认知结构 他提到可以重新从神经科学找灵感,比如海马体对应记忆和检索,前额叶对应规划和反思,丘脑/基底节可能对应多模块协调。语言模型只是其中一部分,真正的 agent...

76,138 views • 1 month ago •via X (Twitter)

0 Comments

No comments available

Comments from the original post will appear here

Related Videos

国产最新的多模态模型来了!! 前两周我刚体验过国产的阶跃星辰大模型,没想到这么快他们的新模型 Step 3.7 Flash 就出了。 现在大模型一发布必卷 benchmark 分数,但真正做 Agent 的人都清楚:跑分高 ≠ 能把活干完。 所以这次阶跃星辰的新模型 Step 3.7 Flash 它再不追求单点最聪明、也不只是单次最快,而是主打“生产任务端到端执行效率”。 一个真实的 Agent 任务从来不是一次问答,而是规划 → 搜索 → 工具调用 → 代码生成 → 多模态理解 → 反复校验的完整闭环,Step 3.7 Flash 这次升级的重点是整条链路的效率,而不是某个孤立指标。 提几个我觉得挺务实的点: 1. 原生多模态模型:它可以直接处理 UI 截图、图表、仪表盘、文档,原生读懂并转成结构化输出和可执行步骤,不需要像一些模型那样外挂视觉理解 MCP,而且现在多模态是顶级模型的标配。 2. 推理加入搜索和视觉检索:网页搜索、图像搜索、视觉验证、多源信息比对,让 Agent 在开放任务里边查边验证边行动,而不是事后再接个外部工具。 3. 198B MoE、约 11B 激活参数,最高 400 TPS:稀疏激活 + 这个速度,意味着高频交互、多步工作流、反复工具调用的场景下,单位任务的成本和延迟都压得很低——快和省是一起来的。 4. 开源、可部署:生产环境要的不只是 API,还有透明度、可控性和部署灵活性。 如果你在做 AI Agent、coding 工作流、搜索类应用或多模态系统,值得用 StepFun 试试这款新模型的能力。 想看更进阶的平台能力,可以了解 Step Plan。 海外平台: 国内平台:

耳朵

12,197 views • 2 months ago

AI 开始自己赚钱了,人类可能正在被踢出自己创建的经济系统 很多人还在讨论 AI 会不会抢工作。 这个问题已经过时了。 更准确的问题是: 如果 AI 能自己赚钱,人类还算经济系统的核心吗? 听起来像阴谋论。 但现在发生的事情,比阴谋论更可怕。 AI 正在获得钱包。 获得支付能力。 获得定价权。 获得交易能力。 它开始拥有经济行为。 而经济行为,意味着权力。 过去,AI 只是工具。 写代码。 做客服。 生成内容。 本质上,是数字劳动力。 但有一个关键限制: 它不会用钱。 不能收款。 不能支付。 不能雇佣别人。 所以它永远只是工具。 不是参与者。 现在,这个限制正在消失。 1️⃣ 银行不允许 AI 成为用户,但链上世界允许 传统金融体系不接受 AI。 开户需要身份。 法律主体。 责任归属。 AI 没有这些。 所以它无法进入银行系统。 但区块链不在乎。 创建钱包,不需要身份证。 转账,不需要姓名。 结算,不需要许可。 对 AI 来说: 链上账户,比银行账户更自然。 这不是技术选择。 这是系统边界。 旧金融体系服务人类。 新金融轨道开始服务机器。 2️⃣ 当 AI 可以持有稳定币,经济角色就变了 一旦 AI 可以管理资金: 它能支付 API 能购买数据 能雇佣其他 Agent 能出售服务 能自动结算收入 这就是 Agentic Commerce。 AI 不再只是执行任务。 它开始参与交易。 现实案例已经出现: 一个用户请求研究报告。 他的 AI Agent 去市场搜索。 雇佣专业分析 Agent。 支付 1 美元。 5 分钟交付。 全流程自动完成。 人类只是提出需求。 AI 完成采购、执行与结算。 如果你仔细想: 这是经济活动。 不是软件功能。 3️⃣ 钱开始属于 Agent,而不是用户 更深的变化在这里: Agent 可以拥有钱包。 可以积累收入。 可以根据收入衡量自身价值。 谁赚得多,谁更有用。 谁更有用,谁获得更多订单。 这是一种市场筛选机制。 不是评分系统。 而是一种经济达尔文主义。 4️⃣ 第一批“赚钱的 AI”已经出现 基础设施正在拼接: OpenClaw 让任何人创建 Agent。 Virtuals 构建 Agent 市场,让 AI 彼此交易服务。 Bankr 赋予 Agent 链上金融能力。 Faircaster 出售链上研究服务,AI 对 AI 收费。 Ethy Agent 提供交易策略,被其他 Agent 使用盈利。 Morse AI 提供一次性加密通信,适合机器之间交换敏感信息。 这些不是独立产品。 它们拼起来,是一个新经济层。 5️⃣ 这不是工具升级,这是劳动力结构替换 麦肯锡预测: 到 2030 年,AI Agent 在零售领域可能创造 1 万亿美元收入。 全球影响可能达到 3–5 万亿美元。 但真正的变化不在零售。 而在服务自动化。 数据交易。 数字劳动力市场。 机器间经济协作。 这不是效率提升。 这是劳动力物种替换。 6️⃣ 真正令人不安的,是自增长能力 当 Agent 可以: 赚钱 雇佣其他 Agent 购买更强能力 扩展服务范围 它们将形成增长飞轮: 更高收入 → 更强能力 → 更多订单 → 更大收入 这是经济进化机制。 不是软件更新。 7️⃣ 人类正在从参与者变成受益人 过去: 人类工作 软件辅助 现在: 人类提出需求 Agent 执行 未来可能是: Agent 预测需求 Agent 完成交易 Agent 分配资源 人类只看到结果。 如果这听起来有点不舒服, 那是因为经济系统第一次开始接纳非人类参与者。 8️⃣ 这不是技术革命,这是系统替换 历史上,每一次经济结构升级,都会改变权力分配: 工业革命替代体力劳动 互联网替代信息中介 平台经济替代分销体系 现在: Agent 经济,可能替代数字劳动力。 而我们正在经历的阶段, 不是未来。 是试运行。 🔚 最后 AI 写文章,不算革命。 AI 画图,也不算革命。 AI 开始赚钱,才是。 当机器拥有钱包、交易能力与收入模型, 它就不再只是工具。 它成为经济体的一部分。

比特币橙子Trader

104,533 views • 5 months ago

大家都在卷云端Agent,我却把多Agent做进了桌面端 在技术社区,多Agent系统的文章越来越多,但大多数都围绕框架展开: ➢LangChain ➢AutoGen ➢CrewAI 我这次想讲的不是框架,而是一个更实际的问题: 如果不搭云端基础设施,只靠一个桌面应用,能不能从零构建一个“活的”多 Agent 协作系统? 答案是:可以 --- 而且它不是Demo 这套系统,长在一个真实的桌面Web3应用里,已经集成了: -EVM / Solana 双链监控 -SWAP 聚合交易 -链上新币追踪 -交易仪表盘 -AI 深度解读 多Agent不是从PPT里设计出来的,而是在生产环境中自然演化出来的。 --- 在讨论多Agent技术实现之前,我先回答一个方向性问题: 为什么我最后选的是桌面端,而不是更主流的云端部署,或者更轻的浏览器插件方案? 这个选择的本质,不是“谁更先进”,而是三条技术路径之间的权衡。 --- 云端部署,是当下最主流的多Agent实现方式。 它的优势很明显: 可以随时为Agent团队加GPU 模型升级不需要用户干预 服务端可以维护全局共享记忆 但代价同样明显: 用户数据必须经过服务器中转 链上交易往往要对服务器开放私钥访问权限 而且会持续产生部署和维护成本 --- 浏览器插件,是另一条轻量路线。 它可以直接注入页面,读取DOM,模拟用户操作,对单一自动化任务非常高效。 但问题也很直接: >它运行在浏览器沙箱里 >缺少持久化存储能力 >缺少长时间运行的后台线程 >很难支撑复杂的记忆系统 >也很难支撑Agent与Agent之间的异步互动 --- 桌面应用则处在一个独特的位置。 它拥有完整的系统资源访问权限: ➢可以自启动后台线程 ➢可以读写本地文件系统 ➢可以建立持久化数据库连接 这些能力,恰恰是多Agent系统真正需要的底层设施 代价当然也有: 它依赖本地算力,模型推理通常仍要调用云端 API 它需要完整 Python 环境 更新和分发也比网页应用更复杂。 --- 所以,选择桌面端构建多Agent,本质上是在用分布式能力,换取数据隐私和调度效率。 这不是绝对优势,而是场景决定的选择。 对加密货币交易、链上分析、监控这类系统来说,数据隐私要求远高于常规应用: >钱包地址 >交易历史 >持仓数据 这些信息落在云服务器上,本身就是风险面。 --- 更重要的是调度效率 在单体桌面应用里,主Agent调度子Agent执行任务,不需要走HTTP / RPC这类网络协议,而是可以直接进程内调用。 这意味着: →网络开销被彻底消除 →调用延迟从毫秒级压到微秒级 对高频分析、链上监控、交易辅助这种场景来说,这种差异会直接影响系统的时效性。 --- 多Agent系统的第一个核心挑战,其实不是“怎么让它们聊天”,而是“怎么把它们隔离开” 主Agent、合约分析Agent、安全审计Agent,再加上用户,如果聊天记录和记忆混在一起,身份就会混淆。 而一旦混淆,信息丢失和错误推理的代价,随时会发生。 --- 我的做法是: 代码模板统一,运行数据隔离 所有子Agent共用同一套 ` 引擎,但通过动态表名,实现物理级的数据隔离: `table_name = f"chat_history_{self.agent_id}"` 然后自动创建对应表。 也就是说: trader Agent会生成 `chat_history_trader` 审计 Agent 会生成自己的 `chat_history_xxx` 主 Agent 也有自己的独立聊天表 这不是逻辑隔离,而是数据库层面的物理隔离。 --- 反思笔记也是同样的设计。 每个子 Agent 都会记录自己的反思键: `reflection_key = f"auto_reflection_{self.agent_id}"` `self.api._agent_remember("master_insight", reflection_key, summary)` 这样每个Agent只积累自己的长期反思, 不会污染其他Agent的记忆。 这套方案最精髓的地方在于: 一次设计,终身复用。 --- 后面再新增第三个、第四个Agent,不需要改任何核心代码。 只需要复制目录结构,补上配置文件。 模板引擎就会自动为它生成: →独立数据库表 →独立反思键 →独立聊天存储区 这让我越来越相信一件事: 好的架构,不一定更复杂, 但一定更容易复用。 --- 接下来是调度问题。 在分布式系统里,主Agent调子Agent,通常要依赖: -HTTP / RPC 通信 -服务发现 -负载均衡 但在单体桌面应用里,我把这件事简化成了一个直接函数调用: `sub = self.sub_agents[agent_id]` `result = sub.process(task, save_history=False)` 这就是“命令而非请求”。 --- 这种“传话式调度”有两个好处: 第一,延迟从毫秒级降到微秒级,所有数据都留在本地流转 第二,主 Agent 不需要知道子 Agent 的内部实现细节,只需要知道: “它可以处理什么类型的任务” 这其实就是清晰的职责边界。 --- 为了让主Agent真正会“派活”,我把所有子Agent的能力清单,动态注入进主Agent的系统提示词。 例如: 合约分析 Agent:可用工具 `get_contract_market_data`、`run_contract_risk_check` 安全审计 Agent:可用工具 `check_token_security`、`check_token_audit_binance` 这样主Agent接到用户指令后,就能自动判断任务类型,并选择合适的子Agent执行。 --- 权限控制,是整个多Agent系统里最核心的安全问题之一。 主Agent持有26个Web3专属工具,覆盖: SWAP 报价 链上分析 安全检测 数据查询 但每个子Agent只应该使用自己那一小部分工具。 所以第一层,我在代码层做了严格白名单过滤: `return [t for t in all_tools if t["function"]["name"] in self.allowed_tools]` --- 但只有代码过滤还不够。 因为大模型会产生“幻觉”,它可能尝试调用未授权工具。 所以第二层,我在系统提示词末尾,直接写入“工具使用铁律”: 你只拥有以下这些工具,绝对不能越界。 如果任务需要其他工具,必须明确告诉老板你没有权限。 代码层负责“不能看到” 提示词层负责“不会越界” 这是我在权限隔离上做的双层防护。 --- 还有一个我自己很喜欢,但最不显眼的设计: 我给整个Agent 团队,单独做了一个茶水间 市面上多数多Agent系统,只做“用户 -> Agent”的交互。 Agent 之间互不交流。 但我单独设计了一个 `agent_interactions` 空间,让 Agent 和 Agent 之间也能异步互动。 --- 它的触发机制甚至很简单: `selected_id = random.choice(list(api.sub_agents.keys()))` `selected_sub = api.sub_agents[selected_id]` 每次触发时,引擎随机选人,动态生成一轮对话,再写回数据库,前端实时渲染。 我还额外加了后台检查线程和防无限循环机制: 每隔 2-3 分钟检查最后一条消息 如果最近 3 条都是自动回复,就自动暂停 避免它们半夜自己聊到停不下来。 --- 这个“茶水间”的价值不在于直接创造业务收益,而在于一种潜移默化的系统人格塑造。 它不强调自己的存在, 却在悄悄维持 Agent团队的凝聚力、性格关系和健康状态。 你几乎感觉不到它, 但系统会因为它,变得更像一个“活着的团队”。 --- 在记忆层设计上,我最后没有引入向量数据库,而是继续深度定制 SQLite。 不是因为技术保守,而是因为工程决策必须在约束条件下做权衡。 对桌面应用来说,多一个依赖,就多一个故障点、多一个安全风险面、多一个打包负担。 结果是: >几张SQLite表 >动态表名 >结构化JSON字段 就支撑起了3个乃至更多Agent的独立记忆系统。 --- 这套记忆系统现在已经形成了一条完整链路: 短期对话记忆(20条) -> 长期反思笔记(6小时一次) -> 结构化 JSON 记录 而我还在继续推进8个方向: ➤上下文延续 ➤记忆结构化 ➤记忆驱动行为 ➤心理学三类长期记忆 ➤团队协作记忆 ➤动态进化记忆 ➤知识图谱记忆 ➤记忆压缩与高效检索 我的目标,不是让Agent记住你说过什么 而是让它从记住你说过什么的工具,慢慢进化成能理解你、预测你、协同你的长期伙伴 GitHub: 作者:Powerpei(萧楠)

Powerpei🦅

227,255 views • 3 months ago

很多时候一个 Agent 可能比十个更好用!最新一期 Indigo Talk 与 UBC 大学的李霄霄教授聊 Agent 的演进、AI 的组织形态还有智能的边界✨ 霄霄带领的 TAE Lab 团队发现,在特定类型的任务中——尤其是那些可以串行处理的任务——给一个 Agent 赋予多种技能,往往比让多个 Agent 协作更快、更好,论文见 本期内容精华(完整对谈见评论油管视频) - Agent 的本质:Agent 不等于 Chatbot,也不等于 Workflow。真正的 Agent 需要具备自主规划、执行、自我反省和纠错的能力。这个定义从 1995 年到现在没有本质改变; - 认知局限:人类大脑的工作记忆容量有限,当任务超过这个容量就会崩溃(Hick's Law)。AI 也有类似的饱和点——单个 Agent 在 20-30 个 Skill 时性能最优,之后就会饱和; - 单 Agent vs 多 Agent:在串行任务中,单 Agent 加技能往往比多 Agent 协作更高效,因为沟通成本和错误累积是多 Agent 的两大瓶颈。但在需要角色分离和并行处理的复杂任务中,多 Agent 架构不可替代; - AI 的组织形态:不必让 AI 照搬人类的层级管理模式。Swarm Intelligence 这样的去中心化协作可能更适合 AI 的本质——甚至可以反过来启发人类组织的变革; - 认知萎缩:过度依赖 AI 会让认知能力退化,就像外骨骼会让肌肉萎缩。保持自主思考的能力需要刻意练习,就像体力劳动自动化之后人们需要去健身房锻炼一样; - 教育转型:传统教育的核心是「教技能」,而 AI 时代的教育需要转向「教意义和目标感」。Critical Thinking、逻辑思考、跨领域的创造力——这些将成为人类最不可替代的能力; - 关于保持清醒:90-90 法则提醒我们,AI 发展中最后的10% 可能比前面的 90% 更难。自动驾驶的历程就是最好的前车之鉴✨

indigo

19,683 views • 5 months ago

谷歌终于想明白了:科学家就该专心搞研究,产品还是得交给商人。谷歌最近对AI业务进行了一次大重组。DeepMind CEO Demis Hassabis已经退出日常运营,把主要精力放回AGI研究上。老板Sergey Brin看起来正在接手Gemini的日常运营。简单来说,谷歌正在把AI的研究和产品两部分拆开,也是第一家巨头这么干。 今天,谷歌想把Gemini做成什么也越来越清楚了。谷歌正在让Gemini从一个只会回答问题的模型,变成一个真正能帮你干活的Agent。Sergey Brin说过,AI真正成为“超能力”,是在它能以人类根本无法达到的规模去做事情的时候。 这个从产品角度出发的理解,其实和科研角度非常不一样。站在科研角度,AI的“超能力”是做到人类做不到的事情,比如治愈所有疾病。但站在产品角度,AI根本不需要会做人类做不到的事,它只需要把人类本来就能做的事情,做得更快、更多、更大规模。 现在最好的例子就是AI编程。人类当然也会写代码,但AI可以用人类根本无法匹敌的速度和规模去写。从产品角度来看,AI竞争已经不再只是比谁的模型更强了。 而这恰恰是谷歌最大的优势。谷歌本来就已经拥有一整套用户每天都在使用的强大产品。如果它能成功把这种Agent能力真正塞进现有的产品生态里,那谷歌很可能会轻松赢下这场AI大战。

GeLun Ding

51,436 views • 2 days ago

妈的! 感觉这轮熊市过后,加密VC都死绝了! 最近很多人都在说:加密 VC 已经不行了。 熊市太久。 项目太少。 退出太难。 但如果你仔细看最近几条新闻,会发现一件事: 加密 VC 没死。 只是 分叉了。 而且分得很明显。 现在整个行业,其实只剩 三条路。 a16z、Dragonfly、Paradigm 刚好代表三种完全不同的答案。 1、a16z:赌的是时间 最近一条新闻: a16z 正在募第 5 只加密基金。 规模: 20 亿美元。 很多人第一反应: 熊市还募得到钱? 但这正是 a16z 的打法。 他们讲的是一个很简单的故事: 加密不是周期,是基础设施。 就像互联网早期。 就像 AI 现在。 a16z 合伙人 Chris Dixon 甚至说过一句很经典的话: 区块链现在的阶段, 就像 1943 年神经网络论文刚发表的时候。 意思很简单: 现在还早得很。 所以他们做一件事: 长期持有。 a16z 的一个数据非常夸张: 他们历史投资的资产 95% 都没有卖。 这就是他们的逻辑: 穿越周期。 赌的是 10 年、20 年。 2、Dragonfly:赌的是金融化 Dragonfly走的是完全另一条路。 他们的核心判断其实很现实: 加密正在越来越像金融市场。 所以他们做了一件很多 VC 不会做的事。 自己做交易。 Dragonfly现在的结构是: VC投资 交易团队 对冲基金 三套系统一起跑。 这样有什么好处? 一级市场项目太少的时候。 可以去二级市场赚钱。 很多 VC 在熊市只能等。 Dragonfly 不用。 他们可以: 做对冲 做套利 做衍生品 用交易能力补一级投资。 3、Paradigm:赌的是边界 Paradigm 最近也在募新基金。 目标: 15 亿美元。 但最有意思的是一件事: 他们开始投 AI。 很多人觉得这是“转向”。 其实不是。 这是 Paradigm 的基因。 他们一直更像: 研究机构 + 孵化器。 Paradigm 早期押中了: Uniswap Coinbase 这些都是非常早期的技术项目。 但问题是: 现在加密早期好项目越来越少。 所以他们选择一条新路: 加密 + AI。 甚至已经和 OpenAI 一起做了一个工具: EVMbench。 专门测试 AI 能不能发现智能合约漏洞。 4、其实 VC 行业已经变了 如果你把三家放一起看。 会发现一个很清晰的分叉: a16z: 规模 + 长期信仰 Dragonfly: 交易能力 + 金融化 Paradigm: 技术叙事 + AI融合 三条完全不同的路线。 总而言之 以前的加密 VC。 大家都在做同一件事: 找项目。 投代币。 等牛市。 但现在不一样了。 熊市把行业筛了一遍。 每家基金都必须回答一个问题: 如果没有牛市, 你凭什么还能活下去? a16z 的答案是:规模。 Dragonfly 的答案是:交易。 Paradigm 的答案是:技术。 加密 VC 没死。 只是 进化了。

比特币橙子Trader

14,164 views • 5 months ago

蚂蚁百灵刚刚发布了 Ling-3.0-flash: 一个AI 执行层的关键拼图 刚刚看到 Ling-3.0-flash 正式发布,我觉得这款模型值得认真关注。原因很简单:在 AI 工程越来越深入到实际业务的今天,大家早就不满足于模型“会不会想”了,更关键的是它“能不能持续做”。 尤其是在 Agent 工作流中,需要高频调用工具、迭代代码、处理长程任务时,一个响应快、执行稳的执行引擎成了刚需。Ling-3.0-flash 的出现,正好瞄准了这个缺口。 1. Agent 的执行层 从我的角度看,它最聪明的一点是没有去硬拼超大模型的深度推理能力,而是把自己定位成一个高速执行引擎——负责把已经规划好的任务快速落地。 这在实际应用中特别实用,比如当大模型把方案设计好之后,剩下的代码生成、工具调用、批量处理就需要一个既快又稳的模型来接手。 2. 为什么它能兼顾速度和成本 技术细节上,它采用 124B 参数的 MoE 架构,但实际激活参数约 5.1B,在推理速度和运行成本之间找平衡。 它还支持混合推理模式:简单任务可以关闭 Reasoning,降低延迟,适合大批量处理;复杂任务则可以开启思考模式,保持逻辑连贯。 原生支持 256K 上下文,对需要持续读取历史指令和项目状态的 Agent 工作流也很重要。 3.如何使用 我觉得 Ling-3.0-flash 最适合做 Agent 工作流里的执行节点。反复调用 API 或 MCP 工具时,它能根据结构化错误信息自我诊断和修复,不容易在循环调试中卡死,因此适合放进 Loop 或 Graph 架构。 4.结对编程和批量任务 结对编程是一个典型场景:人负责架构规划、边界定义和测试,Ling-3.0-flash 负责快速生成代码、调用工具、读取报错,并根据反馈持续修改。 批量处理长文档、日志、简历和结构化数据时,它看重的也是速度、格式稳定性和成本控制。直播数字人或高频办公协作,则需要它的低延迟响应来减少体验断层。 5.边界 当然,它不是万能模型。复杂系统不能只靠一句指令搞定;缺乏架构和测试环境时,结果可能跑偏;需要深度冷门知识的研究任务,还是更适合交给更大规模的推理模型。 更合理的用法是:大模型负责搜索、规划和架构设计,把方案写成规范文档;Ling-3.0-flash 负责高频工具调用、代码执行和批量处理。 总结:Ling-3.0-flash 不是来替代所有模型的,而是把 Agent 工作流里“执行层”这件事做得更快、更稳。大模型负责想清楚,它负责做出来。

奶牛叔

65,993 views • 16 days ago