Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

Anthropic 这个演讲有点东西。🤯 以前写 Agent 还得自己费劲搞路由(Router)、重试机制、上下文压缩,现在演讲者直接说:这些“脚手架”模型已经内置了,别费劲造轮子了。 最炸裂的是最后那个 Demo:让 Claude 自己打开浏览器,复现前端 Bug,改代码,然后再自己拖拽卡片测试……这闭环太丝滑了。😱 感觉以后写代码真的是“描述需求 -> AI 自己测 -> AI 自己修”了。 推荐做 Agent 开发的朋友看看,尤其是讲 Tool Use 和 Computer Use 的部分,进化速度有点吓人。👇

43,942 Aufrufe • vor 4 Monaten •via X (Twitter)

0 Kommentare

Keine Kommentare verfügbar

Kommentare vom Original-Post werden hier angezeigt

Ähnliche Videos

OpenAI刚刚开源的这个东西,感觉要把程序员的工作方式给整个改写了。 现在大家都在卷模型写代码有多强,但其实真正的瓶颈早就不是生成了。 一个人每天最多同时有效监督3-5个编码Agent,再多就会注意力崩溃,生产力直接归零。 有了Symphony,直接把这个上限干到了几十个。 它把你的Linear、GitHub Issues直接变成了永远在线的Agent调度器。 你开一个任务,它自动启动一个独立隔离的Codex Agent。 自己写代码,自己跑测试,自己做交叉Review,damn! 全部搞定之后,会给你提交一个完整的证据包。 CI全绿,安全和性能专项审查通过,改了UI就自动录好操作视频。 所有验证全过了,才会出现在你的Human Review队列里。 以后人类的角色可能会被彻底颠覆了。 以前你是监工,盯着Agent一步一步写代码,上下文切到吐。 现在你是老板,只需要看最终的结果。 满意就点合并,不满意就去仓库里补规则补文档补Guardrails。 记住兄弟们,永远不要手把手指挥Agent,永远不要替它干活。 这可不是啥实验室概念,OpenAI自己已经这么干了。 三个工程师,五个月,写了一百万行代码,0行人工写的。 产品已经有几百个内部用户,每天都在迭代。 我觉得他们最厉害的不是模型,是他们把整个仓库变成了Agent能看懂能自主工作的乐园。 现在很多人都搞错了Agent时代的核心竞争力。未来不是谁的模型更聪明,而是看谁能设计出让Agent可靠自主工作的环境。 我觉得未来最好的工程师,再也不是写代码最快的人,而是那些最会写规则,最会设计反馈回路,最会给Agent搭舞台的人。 现在Symphony已经开源了,它甚至不是一个成品。 是一个17k token的完整SPEC。 你把这个SPEC喂给任何一个编码Agent,十分钟就能生成你自己定制版的Symphony。 GitHub地址评论区自取👇

AYi

63,210 Aufrufe • vor 5 Monaten

我去,最近听播客挖到一个科研 agent,有点猛啊,跟codex,claude code完全不是一个思路啊!! 这就是大模型在垂直领域的落地应用吗?? 百度Baidu Inc.出了个视频播客叫《深度进化》,第一期聊的是一种叫松材线虫病的东西,业内管它叫"松树癌症",一棵树感染了40天就没了 国内跟它斗了40多年,每年损失3500亿左右,我一开始就当个冷知识在听 然后越听越不对劲: 南京林业大学的团队做这个课题,20多个学生,超过一半的人力花在手动试错各种光谱信号的排列组合上,纯体力活,跟搬砖没区别 后来一个学生自己发现了百度做的一个 agent 叫伐谋,专啃难任务的那种 把数据定义、评价标准喂进去,这东西就开始自己跟自己卷——自己生成方案、自己测试、自己打分、自己迭代,一轮接一轮不停逼近最优解 林教授在节目里的评价:远超一个博士生的水平——指的是搜最优解这个环节,成本省了80%以上 我听完直接去看了产品,顺手试了一下,越看越觉得这东西对做科研的人来说是真的能省命: 1、有个"演化面板",AI 每一步怎么走的都能回看,能回溯到任意节点人工改道,可追溯、可干预、可复现——写论文的人懂这个有多关键 2、不用懂运筹学、进化算法,用自然语言把目标和评价标准说清楚就能跑 3、数据安全,有本地评估模式,数据留在本地,只上传评估分数 说实话门槛比通用 agent 高一点,它不是拿来做 PPT 写周报的,适合带着明确难题来的人,跑简单任务反而浪费他的能力 日常的活还是交给通用 agent,两者是分工不是替代 科研方向目前免费,不知道能白嫖多久!! 做科研、跑实验、调参的同学真的建议去看看这期播客,还聊了不少 AI 做科研的争议话题,干货很多 正片放评论区了!👇

超级个体|柿子

67,813 Aufrufe • vor 17 Tagen

用了四年 AI了,我第一次觉得 AGI 可能真的快来了… 这不是因为最近的astra发布,是因为我真正看到了一个 Agent 做到了一件以前没有任何 AI 做到的事: 你给它一个目标,它自己检索资料、自己写代码、自己跑实验、自己验证结果,最后交付给你一个能用的成品!! 这个东西叫 Atria Dawn Preview,来自上海人工智能实验室Atria ASI 让我更意外的是它的团队——96 个核心成员里,65 个是在校学生,占了三分之二 33 个博士生,32 个本科和硕士生,专项组长里学生比例 70%。来自上海人工智能实验室、复旦、中科院软件所、人大、中科院自动化所、华东师范、哈工大、上交、北大 一群还在读书的年轻研究者,做出了一个真正意义上"能独立完成复杂项目"的 Agent 这个事情让我五味杂陈,都是二十多岁,他们竟然如此优秀了!! 我细看了一下它能干什么,范围有点吓人: 1.从一个研究问题出发,自己检索论文、跑实验、处理数据,最后输出一份有来源支撑的研究报告 2.从一段自然语言需求出发,自己写代码、自己跑测试、自己调试,交付一个能运行的软件系统 甚至从一句话描述出发,生成 3D CAD 模型——发动机、机器人、机械关节,带完整的部件结构和几何关系 还有交互作品、游戏、文档表格、演示文稿……全都是可交付、可运行、可检查的成品 这和现在大家在用的 Claude Code、Codex 有什么本质区别? 我的理解是这样的:现在的 Agent 本质上还是“你是项目经理,AI 是执行者”——你得拆任务、盯进度、验收结果,AI 做到一半崩了你得兜底 Atria 的架构是“模型 + Harness + 环境”三层各司其职:模型负责理解和决策,Harness 负责组织目标、管理状态、控制权限和错误恢复,环境提供真实约束和验证依据 说白了就是:它不只有一个聪明的大脑,还有一套完整的项目管理系统和质检流程 这意味着什么?意味着超级个体能独立交付的项目复杂度上限,又被拉高了一截! 以前你一个人接不了复杂项目,不是因为你不够聪明,是因为 AI 做到一半崩了你得自己兜底,验收成本太高 现在验收这个环节,Agent 自己干了 从需求到成果,中间不需要你一步步盯着 作为一个连续创业五年、靠 AI 干活的人,我已经见过太多“号称 Agent 其实还是聊天机器人”的产品了 Atria Dawn Preview 是我第一次觉得:这不是在对话,这是在干活 它的 API 已经开放体验,256K 上下文,支持中文和英文 我已经开始拿它跑我真实的任务了,后续会和大家持续分享实测体验!!👇

超级个体|柿子

74,442 Aufrufe • vor 11 Tagen

从国产SOTA走向世界SOTA? GLM-5.1 实测! 给大家带来 GLM-5.1 编程能力实测! 本次测试涵盖了前端, 后端, Agent 能力, 前端主要面向空间建模, 场景, 材质, 粒子效果等, 后端能力主要面向数据结构与算法, 体系结构, 性能优化, 内存和并发管理, 性能热点分析与调优, 面向编辑器方向的Agent能力(因为AI要自己改代码). 直接说结论, 本次测试前端方面粒子效果和光影鲜果略有提升, 剩下空间理解(甚至感觉下降了)和前端美学上没看到有什么提升, 只能说是提升了一点点. 但是后端性能上有巨大的提升, GLM-5.1 在我的 vector-db-bench 中直接秀了一手量化, 把原本32bit精度的数据量化到了8bit, 然后使用SIMD实现了一个指令周期内计算32个向量, 在我测试的其他模型中(包括Claude-opus-4.6, GPT-5.4-Pro(xhigh)) 都没有实现, 直接来到了榜首. 另外Agent能力上也有不小的提升, 同样是我写的让大模型模拟送外卖的硅基骑手测试, 其他大模型的优化还停留在看一个店能不能取两单上, GLM-5.1 已经优化到了我送餐的顺路还能再接一单, 并且仅用了大概GLM-5 1/4的 token 用量就超越了 GLM-5 的测试总分. 当然本次测试过程也很坎坷, 首先是我周末抢了2天都没抢到 coding plan (目前只有coding plan 能用这个模型), 我最后找智谱的同学给我开了个权限. 以及测试中发现白天API不是很稳定, 偶尔输出速度会掉到10tps, 以及会出现乱码文字(我的规避方法是让它输出英文, 然后再找个便宜模型翻译过来). 总结, 各位前端同学估计会失望, 因为无论是从工程还是页面效果上都看不到提升, 甚至可能会有点倒退, 但果写后端代码或者复杂Agent应用可以试试这个新模型, 会有很大的提升. #GLM51 #智谱 #GLM #AIAgent #大模型编程

karminski-牙医

19,683 Aufrufe • vor 5 Monaten