Video yükleniyor...

Video Yüklenemedi

Ana Sayfaya Dön

卧槽,最近发现一个强的有点离谱的 AI 团队。 96人的团队约 2/3 的研发成员是在校学生,博士、硕士、本科生都有,来自复旦、中科院软件所、中科院自动化所、人大、哈工大、华东师大等高校。 本来以为又是什么学生创业项目,结果顺着他们做的东西看下去,发现不太对劲。 他们做了一个 Agent 模型,叫 Atria Dawn Preview Atria ASI。 官网放出来的 Demo 一个比一个猛。 有科研和深度研究,有完整的软件项目,有交互作品和游戏,还有 3D 建模、CAD 机械结构。 重点不是让模型生成一张图或者一段代码。 而是让模型在一个真实环境里持续推进任务。 Atria Dawn Preview 面向科研、开发和专业工作,可以往下推进资料检索、写代码、调用工具、运行实验,再根据真实结果继续修改。 代码能不能跑,文件有没有生成,结果是否符合要求,也可以通过外部工具和环境继续验证。 看了一圈,我也拿了用它跑了个任务,因为之前9 月 12 日是世界急救日。 我就让它做一个 3D 海姆立克急救法互动学习页面。 就用大白话描述需求后,它开始拆任务、写代码、搭 3D 场景、做交互,再根据运行结果继续修改。 最后就是视频里的东西。 3D 人体模型、施救位置、操作步骤、动作演示都有,整个页面也可以直接操作和交互。 而一个完整的 3D 网页,恰好把 Agent 面对的另一类问题暴露了出来。 今天能力比较强的模型接上 Coding、搜索、文件系统和运行环境,都能完成相当复杂的任务。...

31,475 görüntüleme • 9 gün önce •via X (Twitter)

32 Yorum

阿熊学AI profil fotoğrafı
阿熊学AI9 gün önce

长链路最难的是稳定做完,这篇把问题和方向都讲透了。

李岳 profil fotoğrafı
李岳9 gün önce

没错,对于这方面Atria Dawn还是有信心的。

Mr Paper profil fotoğrafı
Mr Paper9 gün önce

这团队非常厉害,做出来的东西看起来不错,得抽空试试

李岳 profil fotoğrafı
李岳9 gün önce

人才辈出啊,模型还是很顶的

Steven蒙 profil fotoğrafı
Steven蒙9 gün önce

这个用在教学领域应该很不错,现代学生再也不用靠想象一下,来去理解那些抽象的知识点了

李岳 profil fotoğrafı
李岳9 gün önce

可以的,现在已经有一些大模型进入教育领域了

Crio Songo profil fotoğrafı
Crio Songo9 gün önce

在校生团队就能做出能自主推进完整任务的Agent,现在年轻人技术成长速度真的远超预期,得去官网看看Demo。

老于- iThink profil fotoğrafı
老于- iThink9 gün önce

之前用别的agent跑代码也是,报错两三次上下文就乱套了。把Harness做重来维持状态确实是目前唯二可行的方案,就看他们可验证经验这块token消耗控制得怎么样了。

硅谷AI玩家 profil fotoğrafı
硅谷AI玩家9 gün önce

卧槽这也太猛了吧,学生为主的团队能干出这种水平?那个3D急救互动页面看着就很能打

李岳 profil fotoğrafı
李岳9 gün önce

是啊,也是有点意外,而且能力还不错。

林雪 profil fotoğrafı
林雪9 gün önce

学生团队能把长任务跑成这样确实有点离谱,海姆立克那个3D页面已经不是“生成一段代码”了,而是真的在环境里改、跑、再改。现在单步聪明的模型一堆,难的是中间别崩、最后还能验得过,这个判断挺准

李岳 profil fotoğrafı
李岳9 gün önce

是啊,这模型用起来感觉还是有点聪明

筑梦者.eth profil fotoğrafı
筑梦者.eth9 gün önce

看了下demo,搞CAD和3D这个确实有点东西

absolute 絕對 d4yzg0ne. profil fotoğrafı
absolute 絕對 d4yzg0ne.9 gün önce

Harness这个思路是对的,单步再强长任务跑着跑着就幻觉崩盘了

李岳 profil fotoğrafı
李岳9 gün önce

这个优质的项目分享给大家,现在登录还可以领1亿Token。 官网地址: api体验地址:

开心(Kaixiny_7) profil fotoğrafı
开心(Kaixiny_7)9 gün önce

96人团队里2/3是在校学生,这配置有点东西啊

李岳 profil fotoğrafı
李岳9 gün önce

确实有点夸张,不过模型质量还是可以的

魔王w3👿 profil fotoğrafı
魔王w3👿9 gün önce

大白话就能出可操作的海姆立克3D页,步骤和施救位置都齐,这交付能直接打开看

李岳 profil fotoğrafı
李岳9 gün önce

是啊,有点超乎预期

知不道吧 profil fotoğrafı
知不道吧9 gün önce

个人用 AI 做项目,最想省掉的是不断重复交代。前面定好的要求,后面能记住;发现问题,能定位到哪一步。Atria 强调的状态管理,可以拿这种多步骤任务仔细试试。

李岳 profil fotoğrafı
李岳9 gün önce

是啊,上下文不仅能记住,而且能快速找到问题,这也是一种能力优势。

王二狗 profil fotoğrafı
王二狗9 gün önce

出错了还能接着改,最后把活做完,这比单次演示更有看头

李岳 profil fotoğrafı
李岳9 gün önce

用了一下,感觉还是挺聪明的,可以尝试一下。

王二狗 profil fotoğrafı
王二狗9 gün önce

好勒!

阿链 profil fotoğrafı
阿链9 gün önce

确实是强大👍。这个急救页其实把问题说透了:不是会不会搭3D,是中途力度不够、站位错了,它还能不能把流程拉回来。

李岳 profil fotoğrafı
李岳9 gün önce

不仅能做而且还要做好

小李 profil fotoğrafı
小李9 gün önce

能做3D交互是真的牛逼...

云中水 profil fotoğrafı
云中水9 gün önce

海姆立克急救法那个3D页面是直接一次生成,还是中间报错调整了挺多次?

李岳 profil fotoğrafı
李岳9 gün önce

目前该模型也已上线huggingface:

黑夜流浪诗人 profil fotoğrafı
黑夜流浪诗人9 gün önce

原本以为又是个套壳开源Agent的项目,看到跑通真实环境验证有点被惊到,有点意思

浮云客 profil fotoğrafı
浮云客9 gün önce

说白了就是带自动纠错和环境反馈的框架?这跟自己写loop闭环区别大吗

molly profil fotoğrafı
molly9 gün önce

人少不一定弱 关键看你啃的是不是真问题…

Benzer Videolar

最近国内几个模型大厂好像摊上事了? 也不知道真事假事,还是那个姓A的在碰瓷挑事! 吃瓜的时候,突然刷到一个新模型! 乍一看Atria ASI,差点看成了是Astra,真的很像, 模型代号叫 Atria Dawn Preview! 据说背后约三分之二的研发成员还是高校在校学生!! 我是真想知道这群学生能把模型做成什么样? 所以,找了很久才找到了API,接入下来测试了一下, 我用它一句话做个 3D 家装工作台,最后出来的效果居然还可以!! 能画户型、拖家具、改尺寸、保存项目、导出截图、还能自由拖放布置家具, 其实这个任务倒是不难,主要我一句话说的很笼统, 需要它能够理解我的意图,并且准确规划,将这个工作台做的尽可能完善。 但其实,写代码还并不是这个模型的主要能力。 它的定位,是面向科研和专业工作的智能体模型,擅长把一个复杂任务继续往前推进,最终变成可运行、可检查、可使用的成果。 比如从一个问题、一份数据、一段代码或者一篇论文出发,它可以继续完成资料检索、代码实现、实验执行和反馈修正,最后交付研究报告、软件系统、文档表格、演示文稿、三维设计等等。 可以用来做科研、写报告、写代码、画CAD!! 不知道这个API能用多久,后面我可以再测试一下不同的场景。 有兴趣可以持续关注一下!

沐阳

28,159 görüntüleme • 9 gün önce

我找到了最适合学生和打工人使用的 Agent 模型, 而且免费开源 !!!! 像学生和打工人,使用 Agent 最多的场景就是调研、汇报等 而最近我就挖掘到了一个宝藏的开源 Agent ,名字叫做 Atria Dawn Preview (Atria ASI) ,是上海人工智能实验室研发的新一代智能体模型预览版,主要面向科研、开发和专业知识工作。它可以结合资料检索、工具调用、实验执行和反馈修正,把复杂任务逐步推进为可验证、可交付的成果 它背后的研发团队也很特别:大部分的研发成员是在校学生,团队汇聚了上海人工智能实验室、复旦大学、中科院软件所、中国人民大学、中科院自动化所、华东师范大学、哈尔滨工业大学、上海交通大学及北京大学等高校的研究力量 在官方的跑分中,其 AutomationBench 的能力碾压其他所有模型,说明它能真正的像个数字员工一样完成好所有的调研任务,跨应用业务自动化能力十分的强 视频中的案例展示了它在工具和运行环境配合下生成机器人关节驱动模组 CAD 的过程。从任务规划、零件生成和装配,到几何检查及迭代修正,整个流程形成了较完整的工作闭环 最终结果体现了不错的结构完整度和细节表现,也展示了智能体参与三维设计的潜力。不过,这类 Demo 仍需专业工程验证,不能直接视为可采购、加工和装配的生产级设计 目前,Atria Dawn Preview 的代码和模型权重已经按 MIT 许可开源。实际能够完成哪些任务,则取决于算力、客户端以及接入的工具环境 当然也可以直接调用官方的 api,直接赠送 1000万的 token 积分,链接: 项目官网传送门🫱:

Sac

50,623 görüntüleme • 9 gün önce

用了四年 AI了,我第一次觉得 AGI 可能真的快来了… 这不是因为最近的astra发布,是因为我真正看到了一个 Agent 做到了一件以前没有任何 AI 做到的事: 你给它一个目标,它自己检索资料、自己写代码、自己跑实验、自己验证结果,最后交付给你一个能用的成品!! 这个东西叫 Atria Dawn Preview,来自上海人工智能实验室Atria ASI 让我更意外的是它的团队——96 个核心成员里,65 个是在校学生,占了三分之二 33 个博士生,32 个本科和硕士生,专项组长里学生比例 70%。来自上海人工智能实验室、复旦、中科院软件所、人大、中科院自动化所、华东师范、哈工大、上交、北大 一群还在读书的年轻研究者,做出了一个真正意义上"能独立完成复杂项目"的 Agent 这个事情让我五味杂陈,都是二十多岁,他们竟然如此优秀了!! 我细看了一下它能干什么,范围有点吓人: 1.从一个研究问题出发,自己检索论文、跑实验、处理数据,最后输出一份有来源支撑的研究报告 2.从一段自然语言需求出发,自己写代码、自己跑测试、自己调试,交付一个能运行的软件系统 甚至从一句话描述出发,生成 3D CAD 模型——发动机、机器人、机械关节,带完整的部件结构和几何关系 还有交互作品、游戏、文档表格、演示文稿……全都是可交付、可运行、可检查的成品 这和现在大家在用的 Claude Code、Codex 有什么本质区别? 我的理解是这样的:现在的 Agent 本质上还是“你是项目经理,AI 是执行者”——你得拆任务、盯进度、验收结果,AI 做到一半崩了你得兜底 Atria 的架构是“模型 + Harness + 环境”三层各司其职:模型负责理解和决策,Harness 负责组织目标、管理状态、控制权限和错误恢复,环境提供真实约束和验证依据 说白了就是:它不只有一个聪明的大脑,还有一套完整的项目管理系统和质检流程 这意味着什么?意味着超级个体能独立交付的项目复杂度上限,又被拉高了一截! 以前你一个人接不了复杂项目,不是因为你不够聪明,是因为 AI 做到一半崩了你得自己兜底,验收成本太高 现在验收这个环节,Agent 自己干了 从需求到成果,中间不需要你一步步盯着 作为一个连续创业五年、靠 AI 干活的人,我已经见过太多“号称 Agent 其实还是聊天机器人”的产品了 Atria Dawn Preview 是我第一次觉得:这不是在对话,这是在干活 它的 API 已经开放体验,256K 上下文,支持中文和英文 我已经开始拿它跑我真实的任务了,后续会和大家持续分享实测体验!!👇

超级个体|柿子

74,442 görüntüleme • 10 gün önce

AI 每天都在干活,最后为什么只长了数据库? 现在做 Agent,很容易产生一种虚假的繁荣。 日志越来越多,向量库越来越大,接入的工具越来越全,工作流也越来越复杂。 系统看起来什么都留下了。 可下一项相似任务到来时,模型的判断未必比上一次更好。 这就像一个员工每天写十页工作日报。年底一看,硬盘写满了,脑子还停在年初。 存得更多,不等于学得更多。 今天很多 AI 缺的不是第二块硬盘,而是一条能把真实工作变成模型能力的路。 我更愿意把它叫作:能力复利。 工具解决的是“这一次能不能完成”;能力复利解决的是“这一次完成之后,下一次能不能更好”。 这件事必须从完整的工作现场开始。 客户之前说过什么,项目为什么这样决策,哪些方案被否决,谁修改了结果,最终反馈发生在什么时间——如果这些信息散落在邮件、会议、文档和聊天记录里,模型看到的就只是几个孤立碎片。 Alloomi 的 Holistic Context,试图把分散的信息重新组织成一个持续变化的业务世界。 在验证跨会话问答、时间关系和多跳推理的 LoCoMo‑V2 上,取得 97.4%,对照 Mem0‑V3 的 92.5%。 在验证长期信息提取、知识更新和多会话综合推理的 LongMemEval‑S 上,取得 97.6%,对照 Mem0‑V3 的 94.4%;该项公开人类参考为 82.9%。 在千万 Token 历史规模下测试全局理解与信息定位的 BEAM 10M 上,取得 67.0%,对照 Hindsight 的 64.1%。 这些数据背后真正重要的,不是给 AI 增加一个更大的记忆库。 而是让它理解一件事情为什么发生、怎样变化,又是如何走到最终结果的。 当工作现场被完整还原,真正困难的部分才刚刚开始: 这些经历,能不能改变模型下一次的判断? 一次真实任务会留下 Context、Decision 和 Feedback:模型当时看见了什么、做出了什么选择、最后获得了怎样的反馈。 但并不是所有轨迹都值得学习。 错误判断、偶然成功和低质量反馈如果直接进入训练,模型不但不会进化,反而可能把错误放大。 所以 Alloomi 的 Self‑Evolving Agent 会先进行质量筛选和专家锚定,再通过 Online LoRA、跨任务回放与能力蒸馏,把有效经验逐步写入模型。 在验证从复杂上下文中学习新规则并用于后续执行的 CL‑Bench 上,SEA 取得 47.6%,同基座参考为21.5%。 在验证长周期、多阶段经验积累与迁移的 CL‑Bench‑Life 上,取得 32.1%,公开榜单中的 GPT 5.5(High)为22.2%。 在验证跨任务持续学习、环境适应和抗遗忘的 Con.L Bench 上,取得 32.6%,对照 Claude Sonnet 4.6 的22.3%。 跨模型成绩更适合观察公开榜单位置。真正能够判断框架贡献的,仍然是相同基座和相同评测条件下,21.5% 到47.6%的变化。 因为数据库保存的是“曾经发生过什么”。 训练改变的是“以后遇到类似问题会怎么做”。 但能力进入模型,还不能算完成。 最后仍然要回到现实世界,接受一个很朴素的检查: 代码修好了吗?报告能交吗?复杂任务形成了可以验收的结果吗? 在覆盖高经济价值职业任务的 GDPval‑AA Normalized 上,Alloomi 取得 74.2%,对照 Claude Opus 5 的67.9%。 在验证真实职业工作流与专业交付的 JobBench 上,取得57.5%,报告列出的公开参考为54.7%。 在验证真实 GitHub 问题修复、连续软件工程经验迁移和抗遗忘能力的 SWE‑Bench‑CL 上,取得80.6%,对照 OpenCode、Kimi K3 与 FAISS 组合方案的73.3%。 从真实工作进入上下文,从任务反馈进入训练,再从模型能力回到专业交付,这才构成一条完整的成长路径: 真实任务轨迹 → 质量筛选 → 专家锚定 → 后训练 → 评测准入 → 版本回滚。 效果变好,新的能力才能进入下一版本;如果更新破坏了旧能力,系统就回滚。 所以,自进化不是让模型随意修改自己。 而是让它在可验证、可审计、可撤销的条件下持续成长。 过去我们看 Agent,喜欢看第一次 Demo 有多惊艳。 但 Demo 看的是峰值,长期工作看的是斜率。 真正值得观察的,不是它今天执行了多少任务,而是这些任务有没有让能力曲线继续向上。 工具的价值,是帮 AI 做完一件事。 自进化的价值,是让这件事没有白做。 这就是 Alloomi 想建立的能力复利: 让 AI 每完成一次交付,就获得一次成长。 AlloomiAI

知识猫AI实验室

12,802 görüntüleme • 1 ay önce

国产最新的多模态模型来了!! 前两周我刚体验过国产的阶跃星辰大模型,没想到这么快他们的新模型 Step 3.7 Flash 就出了。 现在大模型一发布必卷 benchmark 分数,但真正做 Agent 的人都清楚:跑分高 ≠ 能把活干完。 所以这次阶跃星辰的新模型 Step 3.7 Flash 它再不追求单点最聪明、也不只是单次最快,而是主打“生产任务端到端执行效率”。 一个真实的 Agent 任务从来不是一次问答,而是规划 → 搜索 → 工具调用 → 代码生成 → 多模态理解 → 反复校验的完整闭环,Step 3.7 Flash 这次升级的重点是整条链路的效率,而不是某个孤立指标。 提几个我觉得挺务实的点: 1. 原生多模态模型:它可以直接处理 UI 截图、图表、仪表盘、文档,原生读懂并转成结构化输出和可执行步骤,不需要像一些模型那样外挂视觉理解 MCP,而且现在多模态是顶级模型的标配。 2. 推理加入搜索和视觉检索:网页搜索、图像搜索、视觉验证、多源信息比对,让 Agent 在开放任务里边查边验证边行动,而不是事后再接个外部工具。 3. 198B MoE、约 11B 激活参数,最高 400 TPS:稀疏激活 + 这个速度,意味着高频交互、多步工作流、反复工具调用的场景下,单位任务的成本和延迟都压得很低——快和省是一起来的。 4. 开源、可部署:生产环境要的不只是 API,还有透明度、可控性和部署灵活性。 如果你在做 AI Agent、coding 工作流、搜索类应用或多模态系统,值得用 StepFun 试试这款新模型的能力。 想看更进阶的平台能力,可以了解 Step Plan。 海外平台: 国内平台:

耳朵

12,345 görüntüleme • 3 ay önce

Fable 5.1 + Cursor Cloud Agent + Grok 4.6 + Grok Bot,可能是目前 AI 编程最强的一套“王炸组合” 分工非常明确: - Fable 5.1 负责规划。 - Grok 4.6 负责写代码。 - Cursor Cloud Agent 负责开机器、跑任务、测试和提 PR。 - Grok Bot 负责远程调度、追进度和纠偏。 整个流程可以压缩成四步: Plan → Write → Ship → Steer 乍一看,只是把几个热门 AI 工具串了起来。 但真正厉害的地方,是它没有强迫一个模型从头干到尾,而是把不同模型放到了各自更合适的位置。 复杂需求先交给 Fable 5.1。 它不急着写代码,而是先分析需求、拆解任务、定义验收标准,再决定要启动哪些 Agent。 任务明确以后,Grok 4.6 接手实现。 Cursor Cloud Agent 给它提供独立的云端环境、代码仓库和工具,让它能真正修改代码、运行测试并提交 PR。 Grok Bot 则站在更上面。 它更像这支 AI 团队的技术负责人: 谁来做? 用哪个模型? Agent 有没有跑偏? 任务卡在哪里? 结果是否达到要求? 需不需要继续追加指令? 这些过去都需要人盯着。现在连“管理编程 Agent”这件事,也开始被 Grok Bot 接管了。 所以这四个产品并不是简单叠加。 它们刚好组成了一支完整的 AI 工程团队: - Fable 5.1:架构师 - Grok 4.6:程序员 - Cursor Cloud Agent:云端工位和执行环境 - Grok Bot:技术负责人 以前大家争论 Claude、Grok、GPT 谁写代码最强。 但单个模型再强,也要同时理解需求、设计方案、修改代码、运行测试、处理环境问题和汇报结果。什么都让一个模型干,表面上简单,实际又贵又容易跑偏。 这套组合换了一个思路: 不找一个全能模型,而是给不同模型安排最合适的岗位。 人也不需要守着十几个 Agent 窗口反复追问。 你在手机或 Slack 里发出目标,Grok Bot 负责启动和管理 Cursor Cloud Agents。某个 Agent 卡住了,它继续追;方向偏了,它补充指令;执行完成后,它再把 PR 和验证证据交回来。 这已经不只是“AI 帮你写代码”。 更接近: 你提出目标,一支 AI 工程团队负责把事情推进到可以验收。 当然,原视频主要展示的是工作流架构,不是一份完整的生产实测报告。 “Fable 负责规划,Grok 负责编码”也不一定适合所有项目。最终还要看一次完成率、返工次数、执行速度、Token 成本和人工审核时间。 但方向已经很清楚了。 AI 编程的下一阶段,不会只比哪个模型更强。 而是比谁能把规划、执行、环境和管理组织起来。 一个强模型只能提高单次任务的上限。 一套王炸组合,才有机会把 AI 真正变成团队。

蓝哥AI

30,987 görüntüleme • 21 gün önce

蚂蚁百灵刚刚发布了 Ling-3.0-flash: 一个AI 执行层的关键拼图 刚刚看到 Ling-3.0-flash 正式发布,我觉得这款模型值得认真关注。原因很简单:在 AI 工程越来越深入到实际业务的今天,大家早就不满足于模型“会不会想”了,更关键的是它“能不能持续做”。 尤其是在 Agent 工作流中,需要高频调用工具、迭代代码、处理长程任务时,一个响应快、执行稳的执行引擎成了刚需。Ling-3.0-flash 的出现,正好瞄准了这个缺口。 1. Agent 的执行层 从我的角度看,它最聪明的一点是没有去硬拼超大模型的深度推理能力,而是把自己定位成一个高速执行引擎——负责把已经规划好的任务快速落地。 这在实际应用中特别实用,比如当大模型把方案设计好之后,剩下的代码生成、工具调用、批量处理就需要一个既快又稳的模型来接手。 2. 为什么它能兼顾速度和成本 技术细节上,它采用 124B 参数的 MoE 架构,但实际激活参数约 5.1B,在推理速度和运行成本之间找平衡。 它还支持混合推理模式:简单任务可以关闭 Reasoning,降低延迟,适合大批量处理;复杂任务则可以开启思考模式,保持逻辑连贯。 原生支持 256K 上下文,对需要持续读取历史指令和项目状态的 Agent 工作流也很重要。 3.如何使用 我觉得 Ling-3.0-flash 最适合做 Agent 工作流里的执行节点。反复调用 API 或 MCP 工具时,它能根据结构化错误信息自我诊断和修复,不容易在循环调试中卡死,因此适合放进 Loop 或 Graph 架构。 4.结对编程和批量任务 结对编程是一个典型场景:人负责架构规划、边界定义和测试,Ling-3.0-flash 负责快速生成代码、调用工具、读取报错,并根据反馈持续修改。 批量处理长文档、日志、简历和结构化数据时,它看重的也是速度、格式稳定性和成本控制。直播数字人或高频办公协作,则需要它的低延迟响应来减少体验断层。 5.边界 当然,它不是万能模型。复杂系统不能只靠一句指令搞定;缺乏架构和测试环境时,结果可能跑偏;需要深度冷门知识的研究任务,还是更适合交给更大规模的推理模型。 更合理的用法是:大模型负责搜索、规划和架构设计,把方案写成规范文档;Ling-3.0-flash 负责高频工具调用、代码执行和批量处理。 总结:Ling-3.0-flash 不是来替代所有模型的,而是把 Agent 工作流里“执行层”这件事做得更快、更稳。大模型负责想清楚,它负责做出来。

奶牛叔

66,157 görüntüleme • 2 ay önce

OpenAI刚刚开源的这个东西,感觉要把程序员的工作方式给整个改写了。 现在大家都在卷模型写代码有多强,但其实真正的瓶颈早就不是生成了。 一个人每天最多同时有效监督3-5个编码Agent,再多就会注意力崩溃,生产力直接归零。 有了Symphony,直接把这个上限干到了几十个。 它把你的Linear、GitHub Issues直接变成了永远在线的Agent调度器。 你开一个任务,它自动启动一个独立隔离的Codex Agent。 自己写代码,自己跑测试,自己做交叉Review,damn! 全部搞定之后,会给你提交一个完整的证据包。 CI全绿,安全和性能专项审查通过,改了UI就自动录好操作视频。 所有验证全过了,才会出现在你的Human Review队列里。 以后人类的角色可能会被彻底颠覆了。 以前你是监工,盯着Agent一步一步写代码,上下文切到吐。 现在你是老板,只需要看最终的结果。 满意就点合并,不满意就去仓库里补规则补文档补Guardrails。 记住兄弟们,永远不要手把手指挥Agent,永远不要替它干活。 这可不是啥实验室概念,OpenAI自己已经这么干了。 三个工程师,五个月,写了一百万行代码,0行人工写的。 产品已经有几百个内部用户,每天都在迭代。 我觉得他们最厉害的不是模型,是他们把整个仓库变成了Agent能看懂能自主工作的乐园。 现在很多人都搞错了Agent时代的核心竞争力。未来不是谁的模型更聪明,而是看谁能设计出让Agent可靠自主工作的环境。 我觉得未来最好的工程师,再也不是写代码最快的人,而是那些最会写规则,最会设计反馈回路,最会给Agent搭舞台的人。 现在Symphony已经开源了,它甚至不是一个成品。 是一个17k token的完整SPEC。 你把这个SPEC喂给任何一个编码Agent,十分钟就能生成你自己定制版的Symphony。 GitHub地址评论区自取👇

AYi

63,210 görüntüleme • 4 ay önce

【AI 时代,想学习一个新领域最快的方式:让 AI 读原始论文,先给你摊出一份带出处的研究脉络】 AI 时代,想进入一个新领域,我第一反应已经不是先找课、收藏几十篇文章了。 而是先找到这个领域值得看的原始论文,然后直接丢给 ScienceBuddy,让 AI 先把文献读完,把不同研究的证据、出处和分歧摊出来。 最近刚好试了一下 ScienceBuddy。 它是 PhAI Labs 做的一个免费 AI 科研工作台,目前还是 Preview。 它背后的团队最近其实也做了不少挺有意思的事。 前几天 Anthropic 发了一项工作: Claude 在两名研究者监督下,用不到四周优化了 30 多个生物模型,其中包括 AlphaFold3、Boltz-2,优化后的代码也开源了。 同一天,ScienceBuddy 背后的技术框架 ScienceIDE 也开源了一批真实科研代码环境,覆盖天体物理、海洋气候、等离子体、材料、量子等 7 个学科。 这些任务也不是代码“能跑”就算完成,修改后的科学结果还得和 reference 对得上。 不过相比底层这些技术,我更关心的是: ScienceBuddy 作为普通用户直接能用的产品,到底能不能真的帮我干活? 所以我没有去跑什么特别玄学的科研问题。 而是拿了一个自己一直挺想搞明白的东西: 睡眠不足,到底是怎么影响注意力和工作记忆的? 大家都知道“睡不好注意力会下降”。 但继续往下问,就没那么简单了: 持续注意、选择性注意、分配注意、工作记忆,受到的影响一样吗? 不同研究之间的结论会不会打架? 所以我直接找了 4 篇公开论文,扔进 ScienceBuddy,问它: 睡眠限制、睡眠剥夺和失眠,对注意力和工作记忆分别有哪些证据? 做一张证据表,标注出处、睡眠操作、样本、主要发现,并总结哪些结论一致,哪些不一致。 这次任务大概跑了 155 秒。 我觉得比较有意思的是,ScienceBuddy 没有只丢给我一段: “睡眠不足会损害认知。” 这种看起来正确,但很难继续核验的总结。 它直接把不同研究摊成了一张证据表。 哪篇论文、什么样本、什么睡眠条件、测了哪一种认知能力、主要发现是什么,都放到了一起。 从这次整理出来的结果看: 睡眠不足对持续注意 / 警觉性的影响相对更一致,而工作记忆和一些复杂认知任务上的结果明显更分化。 但我真正觉得 ScienceBuddy 有用的地方,其实还不只是这张表。 而是它的 「轨迹」。 ScienceBuddy 会把任务怎么规划、调用了什么工具、跑了什么代码、得到了什么结果,都摊出来。 最终的结果文件也能直接下载。 如果觉得某一条结论太含糊,还可以直接在原任务里继续追问,让它基于之前的上下文重新处理。 这也是我现在看 Agent 越来越在意的一点: 不是它能不能给我一个“很像答案”的答案,而是它干活的过程,能不能让我翻出来检查。 对做综述、开题、数据分析的人来说,这种工作流应该会比单纯聊天实用很多。 ScienceBuddy 目前首先面向生物医学方向,集成了 224 个科学工具,支持文献检索、数据库查询,以及 Python / R / Bash 等运行环境。 而且现在还是免费的: 邮箱直接注册,不需要邀请码。 我自己会把 ScienceBuddy 当成一种: “进入陌生领域之前,先把原始论文和证据摊开看一遍”的工具。 当然,科研结论不能因为 AI 做出一张漂亮的表就直接信。 ScienceBuddy 目前还是 Preview,真正用于研究之前,结果还是要自己核验。 PhAI Labs

我真的没有拼多多

31,311 görüntüleme • 1 gün önce

到现在都难以相信,Apodex 居然开源了!! 我一度认为非常有商业价值的产品! 还记得第一次用它,惊艳程度不亚于我第一次用Manus! 这次,Apodex 开源正式发布了新版本 Apodex 1.1, 并且提出了一个我非常认可的概念: AI的能力单位,不应该是一次回答,而应该是一项完整任务。 什么意思?一个AI真正想进入工作流,至少要做到几件事: 理解目标、进入真实环境、维持长任务状态、根据中间结果不断调整计划、任务失败后修复、最后交付一份可以核查的成果。 最近刚好在做一个AI项目,是一个工作台,需要评估不同模型组合选型的成本, 为了测试Apodex能做到什么程度,我把模型价格、评测数据和具体场景需求给到它,让它根据我的需求,为四类业务场景完成 AI 模型/API 选型,统一不同厂商的价格口径,计算月度成本,同时满足性能、上下文、工具能力、预算和供应商集中度约束。 它拿到的是不同格式、不同统计口径的数据,有些数据可能不够准确,有些需要清洗,有些需要重新计算。 Apodex没有上来就写报告,它先在Task Board里拆解整个任务,然后根据任务自动组织Agent Team。 第一轮,它已经完成了数据清洗、价格标准化、模型筛选和成本测算, 然后我临时补充了新的需求: 没错,在任务中我可以随时“插话”,补充新的文件和想法。 *中文内容生成的月请求量,从 12 万提高到 24 万; *深度研究中 30% 的场景,必须转到自建环境; *长文档审阅全部涉及敏感文件,也必须本地运行; *月预算不变; 普通AI看到这一堆新的需求,一般都会重新跑一遍。 但Apodex并没有!它保留了原始数据、价格归一化方法、峰谷计价规则和已经验证的计算口径,没有变化的部分原样保留,只是重新调整了变化的部分! 它可以在任务过程中动态调整任务计划!! 这个可能是这个版本最大的一个更新!Apodex 1.1 就像是在维护一个持续变化的任务状态: 它要读取真实文件、拆解工作、推进计算,还要接收中途反馈,判断保留仍然成立的成果,只修正受影响的部分,最后把结果交付成可以继续使用和核查的文件。 这可能才是复杂任务型 Agent 真正应该具备的工作能力。 最后,它交付了两份不同粒度的报告,以及一个包含 18 个工作表的 Excel 成本模型;其中专门新增了“变更与场景”“云 API 重算”“本地候选筛选”“本地 TCO 缺失假设”“保留 vs 受影响”5 张表。 整个过程,特别丝滑。 这也是Apodex 1.1这次最核心的变化:进入真实任务的执行过程。 而所谓真实任务的执行,其实就是你随时可以甩给AI新的资料和要求,而它会有条不紊的把任务进行下去,直到交付给你完整可验证的结果!

沐阳

50,138 görüntüleme • 29 gün önce

谁能想到Jev 居然输给了一个 1.88B 本地开源模型🔥 结果真的有点让我意外: 我做了一个贪吃蛇决策游戏 Jev 30:28 险胜,但是换成同一组 68 道决策题,本地模型准确率直接做到 94.1%,Jev 只有 76.5% 一个错了 4 道题,一个错了 16 道题 我本来只是想测试一下 “小模型决策能力怎么?”,结果我抽完发现,小模型虽然小 但是准确率一点也不低。 1️⃣ 先说我是怎么测的 双方使用完全一样的 12×12 棋盘、随机种子、碰撞过滤和路径规划器,只有遇到多个方向都能走的时候,才把选择交给模型。 最后 Jev 吃到 30 个食物,跑满 256 步 本地模型吃到 28 个,在 239 步被困住。 如果单看这一局的成绩,肯定是Jev 赢了。 但是贪吃蛇只是某一步选错以后,后面整条路线都会变,所以我又补了固定的 68 道决策题。 结果 this-that-model-1.0 答对 64/68,94.1%;Jev 是 52/68,76.5%。 Brier Score 也分别是 0.042 vs 0.133,本地模型给出的概率和真实结果更贴近 2️⃣ 这个模型最离谱的地方,是它只有 1.88B this-that-model-1.0 是一个开源的结构化决策模型,MIT License,可以直接在 Mac 本地跑 它和 Jev 的思路其实很像: 不给你写小作文,也不慢慢吐 Token 给它当前状态、一个问题、几个候选答案,它一次前向直接返回: 选哪个 + 每个选项的概率。 所以任务分流、选 Skill、队列选择、标签判断、Agent 下一步动作这种事情,都很适合 我在 M4 上直接用 MPS + FP16 跑,不需要 API Key,也没有网络请求 不同任务中位延迟大概 225~475ms,Snake 实战中位 475ms,平均约 492ms 一个 1.88B 模型,在 Mac 上已经可以做到亚秒级决策。 这个我觉得挺夸张 3️⃣ 我又单独测了 105 道空间决策题 总准确率 84.8%,随机基线只有 34.3% 其中 Snake 状态题、行列文字状态都是 100%,JSON 状态也有 94.4%。 而且输出特别干净。 没有 JSON 少个括号,也不会突然给你解释人生,只会老老实实从候选答案里面选一个,再把概率交给程序 对于 Agent 来说,这种“无聊”反而挺值钱。 4️⃣ 当然它也不是万能的 完整地图测试只有 60.7%,最短路径距离题更是掉到 28.6% 一旦任务需要真正的多步图搜索、连续计算,它就明显不行了 所以这次结果也不能简单理解成: 1.88B 打败 Jev 贪吃蛇单局上是 Jev 赢了,而且 Jev 这次没有保存同条件延迟数据,速度也没法公平比较 真正让我感兴趣的是另一件事: 很多 Agent 里面那些高频、重复、答案明确的小判断,可能根本没必要每次都调用一个大模型,甚至连云端 Jev 都不一定需要。 一个 1.88B、本地运行、一次前向就结束的模型,已经可以完成绝大多数简单的决策了。 一些无关痛痒的简单的决策都可以交给这种小的本地模式、遇到复杂的任务再交给 GPT、Claude这样的大模型可能会更适合。 我现在越来越觉得,未来 Agent 不一定是“所有事情都找最强模型”。 更可能是: 小模型负责做大量的决策,大模型才是真正的为了我们的工作服务。 如果你们感兴趣 也可以部署一下,再偷偷地补充一句 这个可是很牛的牛津团队开源的:

小墨同学

34,036 görüntüleme • 2 gün önce

昨天发了一个视频,看到评论里有人问:你都在用 Claude Code 了,为什么还要用国内的 Coding Plan? 对我来说,这不是一个二选一的问题,而是一个补充题。 大家都知道御三家的硬实力更强,这点没什么好争议的。但很多日常场景里,国产模型其实已经能在速度、质量、成本之间取得一个不错的平衡。 比如文本处理、资料整理、基础 coding、简单 agent 任务,这类占日常 80% 的工作,很多时候并不一定非要上最贵的模型。对大多数中国用户来说,国产模型更顺手,速度也够,价格还低不少。 还有一个经常被忽略的点,其实是处理速度。 我自己实测下来,国内这些模型在一些简单任务上,接口响应和首字速度都很快。像翻译、语音输入后的文本修正、基础润色、简单改写这类高频小任务,用起来其实很舒服。你并不需要每一次都把最贵、最强的模型拉出来跑一遍。 另外我觉得,现在国内头部几家 AI 厂商,已经不是“能不能做”的问题了。无论是阿里还是字节,一方面有足够的算力和基础设施,另一方面本身也有持续做模型研发和产品迭代的能力。所以在很多高频、日常、成本敏感的场景里,把国产模型纳入自己的工具链,本来就是很自然的事。 所以我现在的看法一直都不是“国产替代”或者“二选一”,而是按场景分工:复杂、高价值任务交给最强模型;大量日常、重复、成本敏感的任务,用国产模型做补充,我觉得这反而是更现实、也更科学的用法。

luolei

32,630 görüntüleme • 5 ay önce

推荐个好东西:火山引擎的 PromptPilot。 之前看 Google 的提示词白皮书,有个点让我印象很深: 他们直接用 Google Doc 管理 prompt,写任务、版本、评估效果。 那时候我就在想,有没有人真把这事儿做成一套完整系统? 现在看到火山这套,有点意思了。 它不只是“帮你写好提示词”,而是把这事儿当作工程问题来解的。 最打动我的,是它在 prompt 优化这件事上做得极其系统,甚至有点狠。 ✅ 从任务出发构造 prompt(带结构、带变量、不是拍脑袋) ✅ 每一版 prompt 都挂着独立评测集 + 自动评分机制 ✅ 没有理想答案也能比对打分(GSB 模式) ✅ 每轮迭代都能 trace 效果,版本可控、可回溯 我们之前做客服对话调 prompt,最常见的就是“改了一句,但说不上来到底有没有变好”。 很多时候上线的版本其实就是“看着还行就先上”。 现在它是:“打一套样本集,系统直接帮你跑出哪一版效果稳定”。 我一直坚持: 模型越强,对 prompt 的要求只会更高。 尤其是在多轮任务、复杂场景里,prompt 不只是“写得好”,而是“是否可控、可管理、可进化”。 PromptPilot 解决的,是这个底层问题。 它不仅能让 prompt 生出来,更重要是——能持续改下去。 版本有 trace,样本能评分,逻辑能反推,工具还能外接, 整个就是“prompt 的 AutoML + GitOps” 一体化工具链。 顺带说一句:这是 2025 火山引擎 FORCE 大会上刚发布的产品,免费版和 Plus 版都开放,9 月前能直接上手全功能体验。 现在市面上很多 prompt 工具做的是“编辑器 + 改写器”, 但你会发现,真正上线之后需要的是一整套治理机制。 PromptPilot 是我目前看到国内第一个跑通这个闭环的, 不是 fancy 的界面,而是认真在解决 prompt 系统演化能力这个问题。 如果你也在做 AI 应用落地,推荐你认真研究一下。 要说缺点:自定义模型没找到海外模型,差评!

凡人小北

95,199 görüntüleme • 1 yıl önce

过去两年,AI 视频一直在卷画质、时长和真实感。 但对世界模型来说,生成得越长,反而越容易暴露一个致命问题:它根本记不住自己刚刚生成过什么。 AlayaWorld 想解决的,就是这个比画质更难的问题。 一段视频,只要前后几帧看起来连贯,观众通常不会深究背后的空间是否真的存在。 但世界不一样。 你往前走了一段路,转身回来,刚才的房子还得在那里。 你中途召唤了一只怪物,模型不但要马上给出反馈,还得让这件事自然地发生在同一个世界里。 这也是为什么世界模型最难的地方,不是生成,而是状态管理。 AlayaWorld 为这件事加了三层机制: 1. 3D Cache 负责记住东西在哪里。模型离开一个区域再回来时,可以重新找到之前的空间信息。 2. 压缩后的画面历史负责记住刚才发生了什么。它不需要把所有旧画面一直塞进上下文,但又不能把过去全部忘掉。 3.漂移训练和 Error Bank,负责处理模型自己制造的错误。因为生成时间越长,前面一个小错误就越可能污染后面的所有画面。 看到这里,我突然发现,世界模型和 Agent 其实在解决同一个问题。 Agent 运行久了会 context rot,忘记原始任务,被错误的历史信息带偏。 世界模型运行久了也会,只不过它忘记的不是文字,而是街道、建筑、人物和刚刚发生过的事。 所以 AI 的下一场竞争,可能不只是生成质量。 视频模型比的是单次输出。 世界模型比的是持续运行。 谁能让 AI 在运行过程中记得住、改得动、错了还能拉回来,谁才有机会把一次生成变成一个真正可以进入的世界。 AlayaWorld 目前还更像研究级原型。公开的推理流程需要首帧图片、相机轨迹和 Prompt,离普通人打开网页就能玩还有距离。 但它已经把推理代码和模型权重公开了。 这个方向终于不只是看一段官方 Demo,而是可以被下载、检查和验证 Alaya Lab

泊舟

479,007 görüntüleme • 2 ay önce