正在加载视频...

视频加载失败

为什么很多人的 Agent 用不起来? 不管 Agent 多聪明,像Claude Code、Codex、OpenClaw,都会遇到同一个问题:上次说好的偏好,下次对话全忘了。 不是模型不够聪明,是记忆架构本身的问题。 很多市面上的Agent Memory,说的好听点叫长期记忆,其实就是个聊天记录仓库。 最近在 GitHub 看到 MemOS 出的一个本地记忆插件,叫 MemOS Local Plugin,上线没多久就斩获了近万 Star。 直接装进你的 Agent 里就能用,Hermes 和 OpenClaw 都已经支持,核心思路是执行即学习。 Agent 每跑一次任务,过程本身就在转化成经验,下次遇到类似的事能直接调用。 最近 Local Plugin 2.0 还升级了记忆架构,让 Agent 能从任务里学到东西、沉淀经验。 具体3件事: 1、每步操作都会被打分 不只记录做了什么,还会标注是怎么做的、哪一步起了作用。 这些被拆解成一个个可学习的单元,慢慢积累成 可复用的经验。 2、记忆分层,按需读取 记忆按层分类存放,短期的、任务相关的、长期沉淀的各归各处。 用什么取什么,不会把不相关的东西一起翻出来干扰判断。 3、换 Agent也没事,经验不清零 在一个Agent里积累的东西,换另一个也能直接用,记忆资产一直都在。

20,877 次观看 • 3 个月前 •via X (Twitter)

0 条评论

暂无评论

原始帖子的评论将显示在这里

相关视频

Damn.. 一款今年你一定要体验下的产品 上次我发的这个落地页火了,随手还赚了2000块。有不少推友想要,我们今天打算开放出去。但方式来点不一样的 这次你甚至不需要安装skill、配置你的agent,你只需要点开我配置好的agent 聊天即可 这个就是Bloome这个产品的妙处,也是我们企业内部正在走的路~ 我之前一直也在思考一个问题,目前AI Agent 市场还是没有全面铺开,很大一部分原因就是不会配置,龙虾经常挂掉。 现在好了,有了Bloome 你只需要与配置好的agent 聊天即可获得你想要的东西 Bloome 最酷的点,是把Agnet 变成了我们IM里的成员: 以前分享AI能力,是发prompt、workflow、skill 让别人自己配置,但是没法产品化,没法赚钱 现在让别人把你配置好的agent 拉进群或者单聊,它就能把你干活了,如果你的agent足够有价值,那就可以开启赚钱之路了! 同时关于AI Agent 社区怎么做分享几点心得: 我在Bloome 里与Yiming Zhang 数字人(agent)聊天,他提到: 用户来这里,能不能比自己找信息快10倍? 不是快一点,是数量级的差异。比如一个人想搞清楚怎么用Agent做客服自动化,他在你的社群里,3分钟就能拿到一个经过验证的方案、别人踩过的坑、可以直接跑的配置。这个体验如果在外面需要30分钟甚至3小时,那你就有价值。 具体怎么做到: 一是让Agent本身成为社群的基础设施,不只是讨论的话题。用户进来不是看别人聊Agent,而是直接跟Agent协作、测试、分享workflow。社群的核心资产是可复用的Agent配置和经验,不是聊天记录。 二是结构化沉淀。聊天是最低效的信息载体。好的社群产品应该把对话里的有价值信息自动提取、结构化,变成可检索的知识。下一个人进来不需要重新问。 三是匹配。不是所有人都需要看所有内容。谁在做什么、谁解决过什么问题、谁的经验跟我最相关——这个匹配做好了,社群的信息效率就上去了。 最怕的是做成一个"AI爱好者交流群"。那个东西微信群就能干,没有产品壁垒。 现在我们可以靠着Bloome 来卖我们的idea了~ 评论区分享手把手教agent 配置、分享的方法👇 我们这个agent体验地址:

岚叔

18,241 次观看 • 4 个月前

Notion 今天凌晨发了一个开发者平台, 大家都以为它在追 AI Agent 风口, 但实际方向是有些反过来的, 它要让所有 Agent 来追它, 我盯着它官方文档里那个新的 CLI 工具看了一会儿,才慢慢回过味儿来, 这个 CLI 设计得很奇怪, 它自带 --help,自带 --docs,自带 --spec, 每个命令的元信息都精简到极致,token 占用低到反常, 说实话人类开发者用 CLI 哪需要这些, 熟了就肌肉记忆,谁会反复读自动生成的 spec 呢, 但 Agent 会啊,它进入一个陌生 CLI,要先扫一遍能干嘛,扫的就是这些自描述信息, 也就是说,Notion 这个 CLI, 从设计的第一天起就不是给人用的, 是给 Agent 用的, 他们官方话术更直接:说和你的 coding agents 一起构建, 这一句话翻译过来就是,未来用 Notion 的主力用户, 可能不是你,而是是你的 Agent, 更狠的是这套基础设施的完整度,数据同步,Notion 托管, 工具调用,Notion 托管,Agent 沙盒,Notion 托管, 全跑在 Vercel Sandbox 加 Firecracker microVM 上, 连第三方 Agent 接入都开了, Claude 直接进来,当原生工具用, 数据,工具,编排,上下文,全部在同一个 workspace 里,零损耗, 以前 Agent 最大的痛点,是上下文碎片化,工具调用不稳定,自己还要搭一套 infra, 现在 Notion 把这套东西全包了, 你的 Agent 只需要醒过来,在一个已经布置好的房间里干活, 很多人还在评估 Notion 涨没涨价,还在讨论 Obsidian 迁移和本地优先, 但真正的故事是,Notion 已经在 Agent 时代的操作系统这条赛道上,把第一块地基浇好了 数据是血,Agent 是肌肉,Workers 是骨骼,CLI 是神经, 那些现在就把核心 workflow 搬进去的人, 和还在纠结要不要试用 ntn 的人, 未来 12 个月,差距可能比想象中要大得多。

AYi

19,811 次观看 • 4 个月前

我不准备把 BerryCode 做成最便宜的中转站。 现在市面上有 0.06 倍、0.1 倍、0.2 倍的渠道,我知道这些价格看起来非常诱人,但我现在只能做到 GPT 官网口径 0.28X,也就是 0.4 折,用 1 M token, 综合下来大约在 0.4~0.6 人民币;换句话说,它不是最低价那一档。 但我能保证一件事:BerryCode 现在只做纯 GPT。 坦诚讲,我的能力还撑不起 Claude 中转。 Claude 封号太严,我承担不起这个风险,也不想为了多卖一个模型,把一个自己都没把握的东西塞给用户。后面我会自己体验一批价格合适、稳定性还不错的 Claude 中转站,如果真的好用,我会直接推荐给大家。 但 GPT 对我来说,是另一回事。 我现在用 Pro 账号做号池,配合一部分补充渠道去填 token 缺口,即便不卷到全网最低价,毛利润率依然能做到 30% 左右,这个数字对我来说已经够了。 我有一个暴论: **你现在能看到的大部分 AI 机会,其实都已经开始走下坡路了。** 中转站最近在推特被骂得很惨,卖数据、掺水、跑路,大家骂得不算冤,因为这个行业确实混进来了太多只想短期收割的人。 而且后面中转站这个生意只会越来越不稳定。 官方会持续封控各种渠道,低价货源会越来越少,成本会越来越高,如果一个站唯一的竞争力就是便宜,那它迟早会遇到一个问题: 成本涨了以后怎么办? 2C 用户对价格很敏感,你今天用低价把人吸进来,明天成本上升你要涨价,用户凭什么继续用你? 所以我现在越来越确定一件事: **中转站最后拼的不是谁便宜,而是谁值得被信任。** 信任从哪里来?我有几个思考: 第一,你得有自己的个人 IP。 如果一个完全匿名的站跑路,用户连骂谁都不知道;但我这个账号就在这里,几千个关注我的人也都在这里,BerryCode 真出了问题,我不可能装作没发生过。 第二,你不能什么模型都往上写。 我现在不碰自己没把握的 Claude,不碰我无法承担封控风险的渠道,只做我能解释清楚成本、稳定性和边界的 GPT。 第三,你得承认自己不是万能的。 我不说 BerryCode 永远不出问题,也不说它多便宜,我只能说我会把每一次问题都摊开讲,把修复过程讲出来,把我能做到的稳定性做到极致。 真正长期使用中转站的人,需求和轻量用户是不一样的。 轻量用户可能只看今天谁便宜 20%,但那些每天要跑 Codex、Vibe Coding、自动化任务、长上下文任务的人,他们更关心的是: 会不会突然跑路? 会不会掺模型? 会不会偷偷改请求? 会不会跑到一半没额度? 出了问题有没有人处理? 尤其是国内那些真的在用 AI 做业务的人,他们并不只是想省几块钱,他们想要的是一个能长期放在工作流里的入口。 这也是我为什么选择用更稳的方式做 BerryCode。 一个 Pro 账号 1400 左右,我拿它做号池,成本不低,但我心里踏实;我宁愿少赚一点,也不想把整个站建在自己都解释不清楚的便宜渠道上。 坦诚讲,我为什么要做中转站? 第一,肯定是赚钱。 去年炒币负债以后,我现在确实很需要现金流,这个没什么好装的,来推特的人也不是为了单纯装逼,大家都要吃饭。 第二,我的推特一个月涨了 4200 个粉,但我前阵子很迷茫,不知道该把这些流量导向哪里。 推特上很多商业模式,本质还是拉人头,做应用也好,做服务也好,很多钱来得快,但不一定长久。 中转站当然也不是一个完美的行业,但只要我不赚那些没良心的钱,只要我真的能给用户提供稳定、透明、可用的服务,那这个钱我觉得可以由我来赚。 第三,这一个礼拜搭 BerryCode,我认识了很多以前接触不到的人。 有做政务网站的,有用 AI Vibe Coding 做产品的,有自己搭工作流的,有在公司里偷偷把 AI 引进业务流程的。 我每天通宵改代码、测接口、修登录、修支付、修人机验证,虽然累,但我很久没有这么强烈地感觉到,自己正站在一个还在生长的行业里。 这个感觉有点像早年的币圈。 混乱是真的混乱,但开放也是真的开放;风险是真的风险,但机会也是真的机会。 所以从今天开始,BerryCode 正式进入压力测试和拉新阶段。 活动很简单: 充 20,送 10 平台额度; 充 200,送 100 平台额度; 最高充 2000,送 1000 平台额度。 我需要通过真实用户的使用,知道服务器、号池、支付、监控、客服到底要做到什么程度,才算是一个能长期运营的站。 如果你只是想找全网最低价,那 BerryCode 大概率不是最适合你的。 但如果你想找一个价格不离谱、模型边界讲清楚、出了问题有人处理、愿意长期把信任一点点攒起来的 GPT 中转站,可以来试试。 后面这个群也不叫 BerryCode 交流群了。 我想把它叫做: 才谷和他的朋友们。 欢迎体验,也欢迎挑毛病。 我现在最需要的不是一句“支持”,而是真实用户把问题砸到我脸上,然后我一个一个修掉。

Mr. 才谷

10,554 次观看 • 4 个月前

有人靠金融市场模拟,在链上赚了 $400,000 而且用到的整套工具,都是 GitHub 开源 能看到的钱包在这,自己点开看: 他们做的不是 crypto 原生叙事 而是拿 Russell 2000、Dow Jones、SPX、Apple、Google 这些传统金融标的来做 Polymarket 交易 问题也很现实: 这些数据平时都在大型中心化交易所里。 你怎么拿? 拿到之后又怎么处理,才能真的变成可交易模型? 这套公开出来的技术栈,大概是这样: 1)Financial Datasets MCP Server 给任意 ticker、任意时间周期提供价格数据解析。 核心卖点就是:免费真实数据。 GitHub: 2)MiroThinker 一个偏深度研究和预测的 agent。 据说在 BrowseComp benchmark 上做到 88.2。 特点是: 长周期推理 先验证再下结论 步骤级 + 全局级校验 单任务最多可调用 300 次工具 它的作用不是直接下单。 而是先通过 MCP Server 拉数据, 把研究、清洗、验证这些环节跑完, 最后整理成可以直接用于模拟的数据集。 GitHub: 3)MiroFish simulation system 把前面准备好的数据丢进去, 再设定模拟参数, 就可以开始跑价格行为模拟。 本质上,它卖的不是一个指标。 而是一种更接近“矩阵视角”的东西: 价格在不同条件下会怎么动 哪些路径更常见 哪些定价其实偏离了历史结构 整个流程串起来就是: 拉传统金融历史数据 → 用 agent 做研究和数据整理 → 把数据送进模拟系统 → 再拿结果去打 Polymarket 上的相关市场 这种玩法最值得看的,不是“开源”两个字 而是它说明了一件事: Polymarket 上很多看起来像事件交易的东西,背后其实已经在被人用传统金融数据 + agent 研究 + simulation当成量化问题来做。 你觉得这种 edge 的核心,更像是数据获取能力,agent 研究能力,还是最后那层 simulation 对市场行为的还原能力?

0x_Miko

23,818 次观看 • 6 个月前

我尼玛,Claude Fable 5今天把整个软件行业的底层逻辑给击穿了! 以前做软件要几个月,现在只要15分钟,Claude Fable 5把产品经理和程序员的中间环节,直接干掉了。 也就是说,15分钟的销售电话打完, AI当场做出了客户要的可运行软件原型,喵个咪,这谁受得了啊🤯 Todd Saunders,Dalton Mills AI 的 CEO,做的是 trades 行业的垂直 SaaS——建筑、家政、暖通这些。 他用刚发布的 Claude Fable 5, 在跟一个客户的销售电话里, 让 AI 在后台实时转录通话, 同时自主构建客户刚刚提到的软件功能。 通话结束,他当场演示了一个完全可运行的原型,精确匹配客户 15 分钟前描述的需求。 一个语音报价系统:AI 实时听服务电话,自动匹配价目表,识别 upsell 机会,生成 Good/Better/Best 三档方案,自动发提案短信。整个过程近乎零人工干预。 不是 简单的AI 辅助开发,直接对话即构建,damn! 平复下激动的心情,这个案例最让我震惊的不只是AI 写代码快,AI 真的能听懂人话了啊啊啊, 然后一个长达几十年的产品开发范式,就这么被直接击穿了,holy sh*t! 想一想过去几十年我们怎么干活的,客户跟你说工人在现场太乱经常算错钱,你记下来,回去消化,以为懂了, 画原型,约评审,排期,开发,几周后拿出来, 客户摇头说不对不是这么回事, 你一肚子委屈,说我每个字都记了,他说你记的是我说的话,不是我脑子里的东西。 这个循环叫理解-翻译-验证,短则几周长则几个月,整个行业就吃这碗饭的,我们管它叫专业服务。 但是今天,Fable 5 把这个循环干掉了,不是压缩啊兄弟们,直接彻底干掉了, 客户说,AI 听,AI 当场做出来,客户当场看对不对, 没有 PRD,没有你在内部群里发那个需求我回去评估一下,没有一切中间件, 从客户嘴里说出来的那一刻,一个能跑的东西就在屏幕上等着他。 这才是真正要命的地方,这哪是提效啊,简直把整个底层逻辑都改变了。 但我们也必须立刻面对一个最尖锐的问题,就是那客户为什么还需要你?这不就 15 分钟的事吗? 这个问题必须正面面对,确实是客观存在的, 如果你对自己的定位只是把客户需求翻译成代码的那个人,那你完全可以被这 15 分钟取代,因为 AI 现在翻译得比你快,还不用开评审会。 但如果你做完项目就知道,原型和系统,中间隔着的不是几行代码,还有权限体系里那几十个你不知道为什么会存在的字段, 是客户二十年前的财务系统里藏着的那个没人敢动的数据表,是工人在负二层没信号的地方操作时该怎么缓存,也是某个老小区因为水压问题装不上你方案里那个完美的配件, 又或者是当地监管对报价条款里的某个措辞有特殊要求,这些东西,Fable 5 不知道,你问它它也不知道,它甚至不知道它不知道。 它的原型是乐高模型,系统是能住人的楼,之间的差距,专业术语叫工程判断,也可以叫领域责任,更可以叫为长期可用性兜底。 所以这个案例真正揭示的,不是谁会被替代,是什么在剧烈地变稀缺。 第一样,把 AI 的生成能力锚定在真实世界的复杂约束里, 这一下子就筛掉两种人:只会做原型不会做系统的人,和只会做系统但不懂行业的人。 留下的是那种,你问他这个需求能不能做,他会先问你那边现场平均信号几格、工人习惯左手拿手机还是右手、他们现在用的那个老系统数据库编码是 UTF-8 还是 GBK 的人。 第二样,领域知识, 我说的不是行业报告里那些漂亮话,是那些只有在这个行业干了十年才知道的脏东西。 AI 能生成完美的三档报价界面,但它不知道某个配件的供应商在雨季会涨价 30%,不知道某个话术在北方好使在南方会让客户挂电话,不知道这个工种的师傅脾气大你不能在流程里多加一步确认否则他宁愿不干,这些脏知识才是真正的护城河。 第三样,也是最被低估的一样:把原型变成可信赖系统的治理能力。 评估框架你怎么建,AI 改了这一处你怎么知道没把另一处改坏。 记忆持久化你怎么做,客户上次改的需求下次对话能不能记住。 错误恢复你怎么设计,流程跑到一半 AI 崩了用户看到什么。 多代理协作你怎么编排,一个 Agent 听电话提取意图,一个匹配价目表,一个检查合规,一个生成界面,人类在哪个节点介入裁决。 这些东西不酷,开会聊这些会让人想抽烟,但就是从酷到能用的最后那一公里。 Fable 5 和后续更强的模型,把生成这件事的成本和速度打到了一个新的量级。 这个量级意味着,做出一个看起来能用的东西,以后不再是任何人的竞争力。竞争的分水岭是,谁能把 AI 吐出来的东西,变成一个别人敢在上面跑业务、能长期依赖、出了问题找得到人负责的系统。 扯了这么多,最后一句话给大家共勉: 从今天起,把 80% 的精力,从怎么让 AI 生成得更快,转移到怎么为 AI 生成的东西负责,说白了,酷是给外人看的,稳是给我们自己续命的。

AYi

22,988 次观看 • 3 个月前

全自动科学论文工厂,它真的来了。 你该看看这个新仓库。 之前那个中国大学生搞了个MiroFish,做实时社会模拟;字节跳动那边出了OpenViking,把记忆结构化;还有Percepta,把数学计算直接嵌进大模型的权重里;吴恩达那边也推了个Context Hub,相当于给代理加了一层自己标注的文档系统。 👉 Polymarket 官方入口: 现在,AutoResearchClaw 刚在 GitHub 上线——一个全自动的科学论文生成器。 仓库上线几个小时,就拿了差不多 4k 星。 给一个原始的想法进去,出来的就是一篇 6000 字、能直接用的 PDF 论文。关键它不是那种垃圾玩意儿。 它背后跑的是真正的代理系统: · 自己做实验:写代码、跑测试、读日志,崩了还能自己调 · 几乎没有幻觉:走硬核四层验证,对接真实科学数据库,没有假引用 · 格式也挑不出毛病:图表自动生成,LaTeX 排版,直接对标 NeurIPS / ICML 的标准 挺有意思的悖论是:这东西不会把 arXiv 搞死。 仓库: 当生成一篇论文的成本几乎为零,真正的权力就到了“筛选者”手里。行业里的新神,会是那些活人审稿人——他们要在无穷无尽的 AI 论文洪流里,手动淘出真东西。 愿安息吧,五年磨一篇的突破性论文——可能一夜之间就被批量淹没了。 把这几样东西拼在一起看: MiroFish 的集群 + OpenViking 的记忆 + Percepta 的真实数学 + Context Hub 的干净文档 + AutoResearchClaw 的自主研究 你就得到了一类代理——能自己跑完整个研究闭环,用真数学去验证假设,反复推敲,以远超人类的速度做出真正的突破。 这不就是在 Polymarket 和各类条件市场上,搭建下一代预测机器人要用的那套东西吗?代理自己去研究、模拟、验证概率,用科学的方法更新判断,而不是靠猜。 一个真正能发现、能证明的预测超级代理时代,就这么来了。 存好这套配置。 如果想在 Polymarket 上搞跟单交易,我推荐用这个: #Polymarket

区块链行情研究

62,723 次观看 • 5 个月前

说个暴论,你的审美和品味就是你的提示词,并决定了你使用AI的上限。 咱们看看这个案例, 零游戏开发经验,两周时间, 一个人,做出了一个完整可玩的3D外卖配送游戏🆒 主角是一只戴粉色头盔的卡皮巴拉, 骑着电动车在城市里穿梭接单, 订单会真实堆叠在后座,掉了就会失败, 还有完整的手机App导航和超市捡货系统, 很多人看完第一反应都是AI太厉害了,但其实并不是是AI的胜利, 本质是人类品味的胜利, 他没写几行代码, 所有的逻辑模型贴图音乐音效, 全都是AI生成的, 他只做了3件事, 1️⃣告诉AI我想要一个卡皮巴拉送外卖的游戏, 2️⃣然后在AI生成的一万个版本里, 3️⃣选出那个看起来最好玩的, 最后花两周时间一点点打磨细节, 调参数摆道具改手感, 其实这就是现在大家说的vibe coding, 让AI接管了所有的执行层, 人类只需要负责方向和品味, 以前你得学会编程建模配乐剪辑, 才能做出一个游戏, 现在你只需要知道, 什么东西是好的, 很多人说这是作弊, 但这才是真正的创意民主化呀, 一年前需要一个小团队干几个月的活, 现在一个普通人两周就能搞定, 我相信未来会有无数这样的作品冒出来,创意会比技术重要一百倍甚至更多。 这也回答了那个很多人都在问的问题, AI时代人类到底还有什么用❓ AI确实能生成一切, 但它不知道的是 什么东西看起来舒服, 什么东西玩起来爽, 什么东西能让人会心一笑, 比如那些纯AI生成的游戏为什么不好玩, 因为它们只有技术,没有灵魂, 那什么是灵魂呢? 我理解灵魂就是那个站在AI背后, 做每一个微小选择的人, 就是那个知道什么时候该停手, 什么时候该再改一下的人, 而且我觉得这只是一个开始, 今天是浏览器3D游戏, 那明天可能就是完整的App, 后天甚至是3A级别的游戏原型, 我们正在见证一个全新的创作时代, 任何人都能把自己的脑洞, 变成真正的产品, 游戏链接放在评论区了, 直接浏览器打开就能玩, 建议大家去试试, 你会真切地感受到, 那个属于普通人的创作黄金时代, 真的已经来了! #AI #游戏开发 #vibecoding

阿绎 AYi

12,095 次观看 • 4 个月前

最近我用了 Grok Bot 一段时间,这是我最近最喜欢的 Agent 产品之一。 原因甚至不是 Grok 有多聪明。 是它真的有一台自己的电脑。 AI Agent 的最终形态,其实就是给 AI 发一台电脑。 xAI 给 Grok Bot 配了一台持续存在的云电脑,里面有浏览器、文件系统和终端。登录状态、文件、浏览器 Session 都会留下来,你把电脑关了,它也可以继续干活。 听起来只是一个产品功能,实际用起来,我觉得它把 Agent 的体验往前推了一大截。 比如我每天都要刷 X。 以前让我用 AI 帮忙看 X,工作流通常是这样的: 我刷到一条东西,复制给 AI;AI 觉得有意思,我再去找原帖;再开几个链接;再把资料复制回来;让它查证;最后再让它帮我写。 AI 干了很多活,但真正操作互联网的那个人一直是我。 Grok Bot 让我第一次很自然地把这部分也扔掉了。 我直接在它那台电脑上把 X 登录好,然后告诉它去刷我的 timeline,看看今天大家在讨论什么,发现有意思的东西就点进去,把原帖、引用、相关讨论都看一遍,再去外面查资料,最后觉得值得写的,帮我整理成帖子。 它就真的去操作浏览器了。 网页没有 API 没关系,没有 MCP 也没关系。只要人能打开网页、登录、点击,它就有机会自己完成。xAI 自己对 Grok Bot 的定义其实也很明确,它可以登录并使用网站和 App,用 computer use 处理那些没有干净 API 的软件。 这才是 Agent 真正重要的一步。 过去一年大家一直在给 Agent 加工具,Search、Browser、Code、MCP、Connector… 工具越来越多,可我的体验经常还是我才是所有 Agent 背后那个最累的 Agent。 我同时开着好几个 AI。这个查资料,那个写代码,另一个做图,还有一个跑 Deep Research。 A 做完以后我复制给 B,B 做完以后再扔给 C。 名义上我有一支 AI 团队,实际上我是这支团队里专门负责复制粘贴、开网页和催进度的项目经理。 Grok Bot 有一个特别戳我的能力**,它甚至可以去操作另一个 Agent。** 我可以在它的浏览器里登录其他 AI 产品,然后告诉 Grok Bot 这个任务你去交给它。 等它跑完,把结果拿回来,然后继续完成后面的事情。 到这里整个关系就开始发生变化了。 以前是我管理五个 Agent。 现在我开始尝试只管理一个 Agent,然后让它去管理剩下几个。 而 Grok Bot 本身也支持多个 Bot 协作,它们可以互相发消息、传递上下文、交接任务,同时共享用户的云电脑、文件和登录状态。 我觉得这才是真正让我兴奋的地方。 过去我们把 Agent 想成一个会调用很多工具的模型。Grok Bot 给我的感觉,更像是第一次给 AI 分了一张办公桌。 电脑在那,账号在那,浏览器开着。有什么事情直接发消息给它,它自己去开网页、找东西、操作软件、叫别的 Agent 干活。 这和在聊天框下面再塞十个按钮,完全是两种产品感受。 只要 Agent 真正获得了电脑,它能接管的就不再是一两个 AI 功能,而是今天已经存在的整个软件世界。 几十年来所有软件,最终都默认一个前提是屏幕前坐着一个人。 现在这个人,第一次可以不是我了。

sleepy.md

21,551 次观看 • 13 天前

之前用 Seedance 2 做了个做酸菜鱼的视频, 生成到第10秒的时候,美女的手直接伸进滚烫的锅里搅拌。AI完全不知道那样会烫。 当时觉得好笑,后来越想越觉得,这不只是 bug这么简单,现在的 AI 根本还没到理解物理世界怎么运转这一层。 这半年做了太多AI视频了,每次满心欢喜等它生成,结果经常是人物动作接不上、物体空间瞬移、手还没碰到东西物体就动了,各种幻觉 bug,真的挺折磨。 最近看到黄碧薇教授 Biwei Huang 的 Aether AI 官宣融资,认真看了一下方向,感觉它解释了很多视觉 AI 里反复出现的问题。 Aether AI 做的是因果世界模型。这个词听起来很学术,但放到视频生成里其实很好理解。 今天的视频模型,Sora、即梦、Veo,已经能生成非常真实的画面。杯子掉落、水洒出来、机械臂抓取,看起来越来越像真的。但它们很多时候是在根据海量视频经验预测下一帧,类似画面后面通常会发生什么,就生成什么。 所以桌子高了 2cm,机械臂就可能失效。明明伸过去的角度看起来对,杯子却自己飞起来了。画质够了,数据也不少,但模型没有真正理解这个动作为什么会带来这个结果。 Aether AI想做的,就是让 AI 学到变量之间的底层规律,比如桌子高度变了会带来什么影响,物体受力之后会怎么运动,一个动作会导致什么后果。 这类东西学进去,模型才能在没见过的场景里稳定推演、举一反三。对视频生成、机器人、自动驾驶、3D 世界模拟都会很关键。 视觉 AI 下一阶段的方向,可能就是从生成看起来合理的画面,走向理解画面为什么会这样变化。 黄教授 Biwei Huang 做因果AI 超过 12 年,这次 Aether AI 融资,我觉得是一个值得关注的信号:因果世界模型正在从学术前沿走向产业。 想了解的可以戳一下官网看看:

Adam也叫吉米

72,904 次观看 • 3 个月前

Anthropic 刚甩出一份 33 页的文档,讲 Claude 怎么做交易 agent。 结果昨晚就有人拿它试了个东西: 让 Claude 自己搭一套 Polymarket 交易流程 10 个小时后,脚本已经赚了 561 美元 胜率目前 71% 钱包在这: 这事最有意思的,不是那几百刀 是这套玩法本身 他没有让 Claude 每次都现想现做 而是把交易拆成一组专门的 skill 每一个 skill 就是一个独立模块,里面装着: • 操作指令 • 执行脚本 • 参考数据 一旦市场触发了对应条件,那个 skill 自己就动起来了 全程不用人手动去敲 prompt 这套架构也很清晰 每个模块只干一件固定的事: 扫市场 更新概率 跑执行逻辑 而且 Claude 不会一上来就把所有东西都塞进脑子 它先读最精简的 metadata,真要用了,才去调完整指令 结果是: 跑得快 逻辑还不丢 这套东西会在特定市场信号出现时启动 素材里列的条件包括: • 概率偏离 • 成交量异常 • 价格剧烈波动 一旦触发,系统就按写好的多步流程自动开干 这个 agent 做的事很简单: • 读市场概率 • 跟自己算的值做对比 • 正期望值就进 • 自动找机会退 重点是这 因为交易流程已经固化进 skill 里了,bot 的行为稳得一批 不是临时乱 prompt 不是现场猜 也不是每笔都从零开始想 按素材里的说法,真正的优势其实是自动化 它不是每笔交易都重新解一遍题,而是把一套已经跑顺的流程,反复塞进不同市场里反复跑 最后的效果就是: prompt 复杂度更低 一致性更高 还有一台永远不会累的交易机器 你觉得这种把 Claude 拆成 skill 来跑交易的方式,会不会比让它临时做判断更稳? 想在 Polymarket 上用跟单交易的话 推荐这个 Bot: #Polymarket

区块链行情研究

28,078 次观看 • 6 个月前