Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

肝了几天,来回打磨了快 30 遍, 一次性把最新的 Claude Code 的 Workflow 给你完全拆解清楚 有人说它的伟大程度,不亚于 MCP 和 Skill。 第一眼我是不信的,直到拆开看它内部怎么跑: 这不是"问一句答一句"的对话,而是一个能自己跑起来的任务系统:后台持续执行、可监控、可保存进度, 还能一口气派出几十上百个 agent 分头干活/合并汇总。 核心就三个角色: Claude 拆任务、定计划; Runtime 管调度和状态; 每个 agent 只啃一个子任务,配上并发池和队列,有节奏地推进。 它代表的是一种新的工程编排方式:智能负责规划,Runtime 负责执行,状态独立保存,模型按需调度。 最反直觉的一点:它能扩展到上百个 agent,靠的不是模型变强,而是"状态外置"—中间结果全交给执行系统保存,主上下文只看摘要和关键判断。这才是复杂任务能跑稳的真正原因。 这条视频直接给了你把它搬进自己系统的方法: 先用 Claude Code 做高质量规划、拆任务定阶段; 再把 workflow 转成自己的执行格式,按任务难度路由到不同模型池,简单的走便宜模型,复杂的才上高阶模型。 这条视频,值得反复看几遍👇

143,271 Aufrufe • vor 3 Monaten •via X (Twitter)

0 Kommentare

Keine Kommentare verfügbar

Kommentare vom Original-Post werden hier angezeigt

Ähnliche Videos

蚂蚁百灵刚刚发布了 Ling-3.0-flash: 一个AI 执行层的关键拼图 刚刚看到 Ling-3.0-flash 正式发布,我觉得这款模型值得认真关注。原因很简单:在 AI 工程越来越深入到实际业务的今天,大家早就不满足于模型“会不会想”了,更关键的是它“能不能持续做”。 尤其是在 Agent 工作流中,需要高频调用工具、迭代代码、处理长程任务时,一个响应快、执行稳的执行引擎成了刚需。Ling-3.0-flash 的出现,正好瞄准了这个缺口。 1. Agent 的执行层 从我的角度看,它最聪明的一点是没有去硬拼超大模型的深度推理能力,而是把自己定位成一个高速执行引擎——负责把已经规划好的任务快速落地。 这在实际应用中特别实用,比如当大模型把方案设计好之后,剩下的代码生成、工具调用、批量处理就需要一个既快又稳的模型来接手。 2. 为什么它能兼顾速度和成本 技术细节上,它采用 124B 参数的 MoE 架构,但实际激活参数约 5.1B,在推理速度和运行成本之间找平衡。 它还支持混合推理模式:简单任务可以关闭 Reasoning,降低延迟,适合大批量处理;复杂任务则可以开启思考模式,保持逻辑连贯。 原生支持 256K 上下文,对需要持续读取历史指令和项目状态的 Agent 工作流也很重要。 3.如何使用 我觉得 Ling-3.0-flash 最适合做 Agent 工作流里的执行节点。反复调用 API 或 MCP 工具时,它能根据结构化错误信息自我诊断和修复,不容易在循环调试中卡死,因此适合放进 Loop 或 Graph 架构。 4.结对编程和批量任务 结对编程是一个典型场景:人负责架构规划、边界定义和测试,Ling-3.0-flash 负责快速生成代码、调用工具、读取报错,并根据反馈持续修改。 批量处理长文档、日志、简历和结构化数据时,它看重的也是速度、格式稳定性和成本控制。直播数字人或高频办公协作,则需要它的低延迟响应来减少体验断层。 5.边界 当然,它不是万能模型。复杂系统不能只靠一句指令搞定;缺乏架构和测试环境时,结果可能跑偏;需要深度冷门知识的研究任务,还是更适合交给更大规模的推理模型。 更合理的用法是:大模型负责搜索、规划和架构设计,把方案写成规范文档;Ling-3.0-flash 负责高频工具调用、代码执行和批量处理。 总结:Ling-3.0-flash 不是来替代所有模型的,而是把 Agent 工作流里“执行层”这件事做得更快、更稳。大模型负责想清楚,它负责做出来。

奶牛叔

66,157 Aufrufe • vor 1 Monat

到现在都难以相信,Apodex 居然开源了!! 我一度认为非常有商业价值的产品! 还记得第一次用它,惊艳程度不亚于我第一次用Manus! 这次,Apodex 开源正式发布了新版本 Apodex 1.1, 并且提出了一个我非常认可的概念: AI的能力单位,不应该是一次回答,而应该是一项完整任务。 什么意思?一个AI真正想进入工作流,至少要做到几件事: 理解目标、进入真实环境、维持长任务状态、根据中间结果不断调整计划、任务失败后修复、最后交付一份可以核查的成果。 最近刚好在做一个AI项目,是一个工作台,需要评估不同模型组合选型的成本, 为了测试Apodex能做到什么程度,我把模型价格、评测数据和具体场景需求给到它,让它根据我的需求,为四类业务场景完成 AI 模型/API 选型,统一不同厂商的价格口径,计算月度成本,同时满足性能、上下文、工具能力、预算和供应商集中度约束。 它拿到的是不同格式、不同统计口径的数据,有些数据可能不够准确,有些需要清洗,有些需要重新计算。 Apodex没有上来就写报告,它先在Task Board里拆解整个任务,然后根据任务自动组织Agent Team。 第一轮,它已经完成了数据清洗、价格标准化、模型筛选和成本测算, 然后我临时补充了新的需求: 没错,在任务中我可以随时“插话”,补充新的文件和想法。 *中文内容生成的月请求量,从 12 万提高到 24 万; *深度研究中 30% 的场景,必须转到自建环境; *长文档审阅全部涉及敏感文件,也必须本地运行; *月预算不变; 普通AI看到这一堆新的需求,一般都会重新跑一遍。 但Apodex并没有!它保留了原始数据、价格归一化方法、峰谷计价规则和已经验证的计算口径,没有变化的部分原样保留,只是重新调整了变化的部分! 它可以在任务过程中动态调整任务计划!! 这个可能是这个版本最大的一个更新!Apodex 1.1 就像是在维护一个持续变化的任务状态: 它要读取真实文件、拆解工作、推进计算,还要接收中途反馈,判断保留仍然成立的成果,只修正受影响的部分,最后把结果交付成可以继续使用和核查的文件。 这可能才是复杂任务型 Agent 真正应该具备的工作能力。 最后,它交付了两份不同粒度的报告,以及一个包含 18 个工作表的 Excel 成本模型;其中专门新增了“变更与场景”“云 API 重算”“本地候选筛选”“本地 TCO 缺失假设”“保留 vs 受影响”5 张表。 整个过程,特别丝滑。 这也是Apodex 1.1这次最核心的变化:进入真实任务的执行过程。 而所谓真实任务的执行,其实就是你随时可以甩给AI新的资料和要求,而它会有条不紊的把任务进行下去,直到交付给你完整可验证的结果!

沐阳

43,632 Aufrufe • vor 5 Tagen

传统的 Deep Research 已经卷到头了。 能写出一份漂亮的总结报告 ≠ 能把真实的复杂任务干完。 我拿几十万字的《红楼梦》原著,给 Apodex 1.1 在线工作台,出了个极其变态的任务。 统计 20 个核心人物的 → 出场次数 → 出场回数 → 每个人第一次出场时的原句 最后还要整理成一张可以直接下载的完整表格。 整个完成任务的过程,像是直接「雇佣一个 AI 数据团队」。 上传文件后,它自己开始拆任务。 一个 Agent 负责解析原著,另一个独立分析,多个任务并行推进; 右侧 Task Board 会实时告诉你现在做到哪一步。 更有意思的是,任务跑到一半,我突然改需求: “只分析前 80 回,后面的不要了。” 以前遇到这种情况,AI 很可能重新来一遍。 Apodex 直接保留已经完成的成果,只重规划受影响的部分。 更关键的是,它不是做完就交卷。 交付前,又调起独立核验 Agent,把人物统计、出场回数和 900+ 条出场原句重新检查一遍。 最后交付给我的是: 可下载的结构化表格 + 完整分析结果 + 口径说明。 这可能才是下一代 Deep Research 真正值得关注的变化: 从“帮你生成一份报告”,变成“接管一项复杂任务,并把它做完”。 目前,Apodex 1.1 Web 端已经正式上线。 🎁 注册即送 credits,强烈建议立刻上传个复杂文件自己跑跑看: 🌐 没想到,更炸裂的是,Apodex 居然开源了 开源模型: Apodex 1.1 mini,35B,开放模型权重,支持本地部署。 开源框架: FrontierAgent,Agent 执行 Harness,支持 ReAct 单 Agent + Multi-Agent Team。 本地运行: 支持 macOS / Linux,无需强制依赖 Docker。 组合能力: Apodex 1.1 mini + FrontierAgent,可在本地运行完整 Agent 执行流程。 💻 如果你是开发者,这里有开源 Agent 框架,欢迎顺手点个 ⭐: 👉 🤗 想本地自己跑模型的看这里👇 #Apodex #DeepResearch

前端哥Liam

92,119 Aufrufe • vor 5 Tagen

国产最新的多模态模型来了!! 前两周我刚体验过国产的阶跃星辰大模型,没想到这么快他们的新模型 Step 3.7 Flash 就出了。 现在大模型一发布必卷 benchmark 分数,但真正做 Agent 的人都清楚:跑分高 ≠ 能把活干完。 所以这次阶跃星辰的新模型 Step 3.7 Flash 它再不追求单点最聪明、也不只是单次最快,而是主打“生产任务端到端执行效率”。 一个真实的 Agent 任务从来不是一次问答,而是规划 → 搜索 → 工具调用 → 代码生成 → 多模态理解 → 反复校验的完整闭环,Step 3.7 Flash 这次升级的重点是整条链路的效率,而不是某个孤立指标。 提几个我觉得挺务实的点: 1. 原生多模态模型:它可以直接处理 UI 截图、图表、仪表盘、文档,原生读懂并转成结构化输出和可执行步骤,不需要像一些模型那样外挂视觉理解 MCP,而且现在多模态是顶级模型的标配。 2. 推理加入搜索和视觉检索:网页搜索、图像搜索、视觉验证、多源信息比对,让 Agent 在开放任务里边查边验证边行动,而不是事后再接个外部工具。 3. 198B MoE、约 11B 激活参数,最高 400 TPS:稀疏激活 + 这个速度,意味着高频交互、多步工作流、反复工具调用的场景下,单位任务的成本和延迟都压得很低——快和省是一起来的。 4. 开源、可部署:生产环境要的不只是 API,还有透明度、可控性和部署灵活性。 如果你在做 AI Agent、coding 工作流、搜索类应用或多模态系统,值得用 StepFun 试试这款新模型的能力。 想看更进阶的平台能力,可以了解 Step Plan。 海外平台: 国内平台:

耳朵

12,345 Aufrufe • vor 2 Monaten

最近当大家都在刷屏Fable 5和GPT-5.6 的时候, 殊不知腾讯已经悄无声息的把大模型能力给追上来了。 你们知道腾讯低调到什么程度吗? 前几天发布的Hy3 ,21B的激活参数已经可以打平旗舰水准,并且直接塞进微信10 亿+用户手里 , 这才是国产大模型真正的王炸啊兄弟们! 说实话周一刷到 Hy3 发布消息那会儿, 我第一反应跟很多人一样:又一个卷参数的国产模型? 趁着周末有空,我仔细翻了一圈资料, 发现完全不是这么回事。 原来Tencent Hy这个模型从一开始就不是朝着聊天模型去的,人家的定位就是奔着干活去的 Agent 向 LLM。 另外最反直觉的是它的推理效率,295B 总参数, 实际激活只有 21B 的 MoE 架构, 就能打平参数是它 2 到 5 倍的旗舰模型, 这事儿我琢磨了一下,其实有点像团队管理, 并不是说人越多产出越高, 关键得看真正干活的那几个人靠不靠谱。 为什么这个效率重要呢? 你想想微信每天服务 10 亿人, token 成本多一厘都是天文数字, 21B 激活还能打出旗舰水准, 我觉得这才是它能被规模化铺开的根本原因, 跟刷榜没半毛钱关系。 说到刷榜,我仔细研究之后这个版本还真不是, 从 preview 到正式版,Hy3 是Hunyuan团队拿了50 多个真实业务的反馈不断迭代出来的,内部 WorkBuddy 任务成功率从 72% 干到 90%,耗时降了 34%,幻觉和常识错误全往下掉。 我原来以为 Agent 的核心是想得多深, 后来发现真正决定能不能上生产的,是稳不稳, 比如工具编排会不会中途崩,出错了能不能自己爬回来,换个框架差不差太多等等, 就是这些不起眼的东西, 才是能跑完一整套 workflow 不掉链子的关键。 当然实际测试下来Hy3 也有短板, 比如纯视觉它还不够强,不过腾讯也有单独的多模态大模型线,它能打的主要还是 coding、办公、复杂任务规划这几块。 最后说个我的一个判断:就是接下来大模型拼的可能不是谁参数更大了,核心看谁能把干活的能力以最低摩擦送到更多人手里,比如Hy3 我理解它可能不是一个更会聊天的模型,更像是一个更会干活的 Agent 底座。 话说回来,腾讯这步棋确实走得挺狠, 我觉得国产大模型的拐点真的要到了, 下方视频是我用Hy3跑的几个测试案例, 分别让它做了一个介绍自己的HTML网页, 一个我的认知系统agent网页, 和做了一个10页的PPT,都很惊艳,大家可以感受下, 会干活、会自检、还会主动说自己哪没做到位, 我觉得这才是 Agent 时代,真正能用的模型该有的样子hh~ #Hy3 #Hunyuan #TencentAI

AYi

194,015 Aufrufe • vor 1 Monat

这两年我一直有个默认假设:模型参数越大,能力越强,什么任务都该交给最大的那个模型去做。但最近我在搭一个需要长流程、反复调用工具的 Agent 任务时,专门试了试把"规划"和"执行"拆开、交给不同模型来做的思路,用的执行端模型是Ant Ling刚发布的 Ling-3.0-flash。这次体验让我对"大模型不是越大越好"这句话有了更具体的理解。 我遇到的问题 起因是我想搭一个 Blender MCP 的工作流:让 AI 帮我自动完成一个简单场景的粗模搭建和运镜——比如摆几把椅子、设置一个摄像机轨迹,作为后续正式渲染前的预演草稿。 一开始我图省事,直接让一个参数量很大的全能模型来处理整个流程:既要它想清楚场景该怎么布局、镜头该怎么运动,又要它高频地调用 Blender 的 MCP 接口去逐步执行动作。 结果是,虽然效果还行,但每一步操作等待的时间都不短,跑完一整套流程花的时间和成本都超出了我的预期——毕竟这类任务里,真正需要"深度思考"的部分只占很小一块,绝大多数时间都花在了"调用接口、摆放物体"这类重复动作上。 换成"规划-执行分离"之后 我把流程拆成了两段:先用一个知识面更广的大模型,把场景的整体构图、镜头运动路径想清楚,写成一份结构化的操作说明;然后把这份说明交给 Ling-3.0-flash,让它作为执行引擎,逐条读取说明并调用 Blender MCP 接口去落地。 这一次的差别很明显。Ling-3.0-flash 的总参数量是 124B,但实际推理时只激活 5.1B 参数,加上首字延迟能做到 500 毫秒以内,我能感觉到每一步操作的响应几乎是"秒回"的——不再是那种等大模型"想"完再动手的节奏,而是我一条指令下去,场景里的物体几乎立刻就摆好了。整套流程跑下来,成本也比全用大模型的方案低了不少。 我的体会 这次尝试让我确认了一件事:如果任务里"想清楚该怎么做"和"把已经想清楚的事情执行出来"这两部分能拆开,那把执行这一段交给 Ling-3.0-flash 这类专门优化过工具调用稳定性和响应速度的模型,确实比一个模型包办到底更划算。 但我也发现,这套分工不是无脑套用的——如果场景本身很复杂,需要边搭建边做美学判断(比如构图是否好看、光影是否协调),单靠 Ling-3.0-flash 自己去决定,效果就会打折扣,这部分还是得靠前期规划阶段先想清楚。 人负责把边界和验收标准定好,大模型负责规划,Ling-3.0-flash 负责又快又稳地把方案落地——这套组合让我第一次比较直观地感受到"规划-执行分离"这套架构的实际好处。 目前Ling-3.0-flash 现已在 OpenRouter 上线——并可免费使用至 2026 年 8 月 3 日。 链接: 也可以直接网页对话体验: 大家不妨去体验体验一下,感受下魅力

韭菜饼子

83,352 Aufrufe • vor 1 Monat

最近拿 StepFun 的 Step 3.7 Flash 跑了一次完整的自动编程流水线,从需求文档到能用的工具,65 分钟,中间没碰键盘。 先说模型。Step 3.7 Flash 的定位是把 Agent 工作流从头跑到尾:规划、写代码、跑测试、审代码、出错重试,看的是整条流程跑完的综合效率。原生多模态,开源可部署。Agent 循环一次要调几百次模型,快和便宜在这里不是锦上添花,是能不能跑得起的问题。 再说项目。hero-coding 是我用 Go 写的一个自动编程流水线:输入一份 Markdown 需求文档,四个 Agent 执行——Planner 把需求拆成带依赖关系的小任务,Worker 在独立的 git worktree 里写代码提交,Verifier 跑测试出硬证据,Reviewer 审 diff,通过就合入主干,不过就打回重做。四个角色全部由 Step 3.7 Flash 驱动,区别只是 system prompt 和工具权限。 这次给它的需求:做一个 Agent 运行日志分析工具,读日志文件,统计每个 Agent 的调用次数、成功率、平均耗时、token 消耗,找出最慢和最不稳定的 Agent。 实际跑下来: · Planner 把需求拆成 6 个任务,自动排好依赖顺序 · 6 个任务全部自动交付,逐个合入主干 · 期间 Reviewer 打回 5 次——有测试全绿但被审出正确性问题的,有只改测试期望值想糊弄过去被拒收的,全部在重试轮次内自动修复 · 不是一个模型在自言自语,是多个 Agent 在互相检查,而且检查真的拦住了东西 · 最终产出的 CLI 直接能用,视频结尾是它分析真实日志的输出 视频是完整过程的运行日志。 国内: 海外: StepFun

劳伦斯

51,937 Aufrufe • vor 2 Monaten

很多人一聊到选哪条链?第一反应都是: 热度高不高?补贴多不多?生态有没有流量? 但今天听了 Talus 🐸 CEO Mike Hanono 和 The Rollup 的视频会议,我反而有种感觉:这不是在给 Sui 站台,更像是一场技术自白。 首先Talus 选 Sui,真的不是因为它现在火。而是因为 Talus 想做的这件事,在别的链上,很难跑得像样。先说清楚一点:Talus 要做的不是一个 AI 应用,也不是几个 bot、几个策略脚本。它想做的是——一个大规模、自主运行的代理网络:成千上万个代理同时运行、同时决策、同时交互。光是这个前提,就把底层链的门槛直接拉满。 为什么是 Sui?我听下来,核心其实就三点。 第一,并行执行。代理世界不是排队点菜,不是你先我后那种单线程逻辑。代理一多,如果底层还是串行执行,结果只有一个:越跑越卡,最后只能做 demo。Sui 的并行执行,本质上就是为“多主体同时操作” 这种系统准备的,这点和 Talus 的形态非常贴合。 第二,高吞吐量。代理不是偶尔动一下,而是持续、高频地产生状态变化。TPS 要是撑不住,所有“自主”“实时”都会变成慢动作回放。对 Talus 来说,吞吐量不是加分项,是能不能活下来的前提条件。 第三,移动端和安全模型。这一点很多人会忽略。未来代理不只在服务器、交易后台跑,它一定会越来越靠近用户。Sui 在账户模型和安全设计上,本身就更像现代应用,而不是早期 DeFi 那套「钱包就是一切」的逻辑。 所以当 gmike 说“我们一直都是 SUI Maxis”,我反而觉得这句话挺克制的。这不是情绪站队,而是工程师视角下的现实选择。至于多链?我自己的理解是:Talus 不是不懂多链,而是很清楚——在基础设施阶段,过早多链只会把复杂度放大。尤其是代理这种高度耦合、强调协同的系统,先把一个底层跑通、跑稳,比到处铺点重要得多。很多项目喜欢先讲“未来多链叙事”, 但真正做底层的人,往往会先问一句:现在这个系统在哪条链上能真正跑到规模?从这个角度看,Talus 的选择是理性的,也是偏长期的。不追热点,不抢流量,先把代理世界里最难的那一块解决掉。这种项目短期不一定最热,但一旦真跑起来,后面的持续热度,反而会非常高。 Kaito AI 🌊 #Yapping #MadewithMoss MOSS #Starboard Galxe River River4FUN 🐝

百里 🌊RIVER | MemeMax⚡️|🧠SENT

13,710 Aufrufe • vor 8 Monaten

昨天看很多人转发Apodex 1.1 一个专门面向深度研究而打造的 Agent 专门解决那种"没有现成答案、需要大量调研才能搞定"的硬问题 好奇测试了下,跑了俩任务,一下午都没跑完😅 执行时间是真长 这玩意能你只要给它个目标,它就能能长时间运行、失败后能自动修复,还能自己验证交付结果是否准确 它在接到任务后,主 Agent 拆解成各种子问题,异步派发给专业化的子 Agent执行,每个子 Agent 有自己独立的上下文、提示词和工具集。 子 Agent 的报告汇入共享报告池,编排器异步读取,不会被最慢的那个卡住。单任务最高可调度 150 个子 Agent 解决的是什么问题呢? 过去: 一次提问,一段回答,一份报告。 衡量标准通常是: 答案对不对 知识覆盖够不够 引用多不多 报告写得是否完整 Apodex 想提出的新的要求: 一项从输入到交付的完整任务,衡量标准变成: 是否理解目标 是否能操作真实文件 是否能调用代码和工具 是否能维护长任务状态 遇到变化能否局部调整 执行失败能否自行恢复 最终结论是否可以核查 因此,它真正挑战的是当前 Deep Research 的产品形态: 搜集资料和生成报告,只覆盖了复杂任务的一部分。 真正的专业任务还需要读文件、清洗数据、选择方法、执行代码、处理异常、核查结论。 所以特别适合:科研人员、分析师、专业用户

小互

13,576 Aufrufe • vor 5 Tagen

自从马云重新现身后, 蚂蚁集团一直猛冲AI,大动作不断! 像是卯足劲在追赶阿里QWEN! 最近更是连发两款实用拉满的模型!!! 先是百B级的 Ling 2.6 Flash, 盲测阶段就冲上 OpenRouter 趋势榜第一, 直接火到了海外!! 还不算完,Ant Ling 今天又甩出一张底牌: Ling 2.6 1T ! 名字就能看得出来,这个模型能力会更强!! 但有一个误区:能力强的不一定是思考模型! Ling 2.6 1T 不靠拉长推理链条来显得"很聪明", 而是把 token 更多花在理解、规划和输出上。 换句话来说: 它的核心定位,是面向复杂任务,是精准指令下的执行模型!! 1M 超长上下文,能把会议纪要、群聊记录、项目文档、零散资料一次性扔进去统一处理。 强工具调用能力,可以接进 OpenClaw、Hermes、LangGraph、Dify 等跑工作流。 真实问题处理,不只生成漂亮 demo,而是能够读懂已有代码,按照你的要求去干活。 Token 效率更高,不默认展开超长思考,成本控制到最低。 最近一段时间都是免费用,不用白不用, 我拿了几个真实任务跑了一遍,感受超级明显—— 如果是模糊的指令,它可能不太适合。 但如果是比较详细的指令,给它一个工作流, 就完全起飞了!! 没有了推理过程,感觉非常丝滑, 这一点,就挺重要的!! 减少了很多“AI自作聪明”的麻烦!! 说回蚂蚁这两款模型, 完全是冲着落地应用来的,几乎把简单和复杂的应用场景全部包圆。 1T 负责理解复杂目标、拆解任务、整理材料、制定计划。 Flash 负责快速执行、快速改写、快速补全。 这精准切入了现在大多数人用AI的“痒点”: 总想着用一个“最强模型”解决所有的事情。 但我认为真正重要并且正确的是: 让对的模型干对的事。 这样无论是速度、成本、还是结果一致性,都更能符合预期。

沐阳

116,421 Aufrufe • vor 4 Monaten