Loading video...

Video Failed to Load

Go Home

我的ads指纹浏览器到期了,我是不打算再续了,本来想 让AI给我写一个出来,后来在git上找了开源的Prism Browser Community。指纹浏览器吗,出现过还多次盗 刷,所以我需要他的安全审计报告,官方没出,我自己想办法 这时候,我发现了Apodex,用 Apodex 1.1 把 Prism Browser Community(DFarm6)的安全审计跑完了。真 正有感觉的不是“会写报告”,是它把 reasoning 放进长任务执行里。 这次不是一个 Agent 从第一行抠到最后一行。开了 Deep Discover 之后,异步 Agent Team 自己看这活能不能拆、 怎么拆、该丢给几个 Subagent。隔离、加密、内核从哪 来、反指纹补丁、联网面,几条线一起跑;谁先出结果就 先回流到共享任务状态,主任务边收边改优先级,不用卡 着等所有支路收工。 更对味的是 mid-task intervention。审计这种事,开头那 句话基本定不完。跑着才会发现要补文件、范围该收一 收、某条线没必要再跟。随时插一句就行。 说白了:Environment Scaling 是让它真能在文件和代码 环境里动手;Agentic Coordination Scaling 是把拆任 务、并行、异步回收结果、中途改计划,练成模型自己会 的事。复杂审计要的就是这种 working capability——能 一直往前推,能随时插手,结论还能回头核对。 另外还有 Apodex 1.1...

12,921 views • 2 days ago •via X (Twitter)

0 Comments

No comments available

Comments from the original post will appear here

Related Videos

Claude Opus 4.8 出了之后,我的第一反应是:想试。 第二反应是:算了,token 这东西真的不经烧。 结果看到 ZenMux 现在可以体验 Opus 4.8,就拿它试了一个我最近一直想做的小东西。 我自己有个很真实的问题: 脑子里经常冒出各种产品想法。 但每次真要开始做,就会卡住。 用户是谁? 第一版到底做什么? 哪些功能应该先砍掉? 怎么定价? 第一周从哪一步开始? 上线后怎么找第一批用户? 想法很多,执行很散。 所以我让 Claude Opus 4.8 做了一个「一人公司作战室」。 需求我写得也挺直接: 输入一句产品 idea。 自动拆出产品定位、MVP、开发任务、定价方案。 再生成落地页文案、冷启动实验、风险清单和本周计划。 最好不是一个静态页面,而是真的能点、能改、能导出。 然后我就把这段话丢给 Claude Opus 4.8。 出来的效果比我预期好不少。 它真的把“一人公司怎么从想法走到执行”这件事拆开了。 左边输入产品想法。 中间生成产品蓝图、MVP 范围、定价和官网文案。 右边是任务看板和本周计划。 底部还有冷启动实验、风险雷达和 Markdown 导出。 最让我觉得有意思的是,它不是一味堆功能。 比如我输入“给小红书博主做 AI 选题助手”,它会主动判断: 第一版必须做什么。 哪些功能看起来高级,但现在应该先别碰。 怎么找第一批真实用户。 哪些风险可能让这个项目做不下去。 这点就很能体现 Opus 4.8 的能力。 普通模型经常是:你要什么,我全给你加上。 最后页面很热闹,但产品判断是空的。 Opus 4.8 更像是在帮你收敛:先想清楚用户、场景和第一步,再把它变成可以执行的工作台。 我是在 ZenMux 上试的。 它比较方便的一点是,一个 Key 就能切不同模型,新模型上线也很快。 Opus 4.8 拿来做这种带产品判断、交互状态和复杂信息结构的网页,确实挺顺。 想试 Claude Opus 4.8 的,可以从这里进:

Joruno

16,224 views • 3 months ago

到现在都难以相信,Apodex 居然开源了!! 我一度认为非常有商业价值的产品! 还记得第一次用它,惊艳程度不亚于我第一次用Manus! 这次,Apodex 开源正式发布了新版本 Apodex 1.1, 并且提出了一个我非常认可的概念: AI的能力单位,不应该是一次回答,而应该是一项完整任务。 什么意思?一个AI真正想进入工作流,至少要做到几件事: 理解目标、进入真实环境、维持长任务状态、根据中间结果不断调整计划、任务失败后修复、最后交付一份可以核查的成果。 最近刚好在做一个AI项目,是一个工作台,需要评估不同模型组合选型的成本, 为了测试Apodex能做到什么程度,我把模型价格、评测数据和具体场景需求给到它,让它根据我的需求,为四类业务场景完成 AI 模型/API 选型,统一不同厂商的价格口径,计算月度成本,同时满足性能、上下文、工具能力、预算和供应商集中度约束。 它拿到的是不同格式、不同统计口径的数据,有些数据可能不够准确,有些需要清洗,有些需要重新计算。 Apodex没有上来就写报告,它先在Task Board里拆解整个任务,然后根据任务自动组织Agent Team。 第一轮,它已经完成了数据清洗、价格标准化、模型筛选和成本测算, 然后我临时补充了新的需求: 没错,在任务中我可以随时“插话”,补充新的文件和想法。 *中文内容生成的月请求量,从 12 万提高到 24 万; *深度研究中 30% 的场景,必须转到自建环境; *长文档审阅全部涉及敏感文件,也必须本地运行; *月预算不变; 普通AI看到这一堆新的需求,一般都会重新跑一遍。 但Apodex并没有!它保留了原始数据、价格归一化方法、峰谷计价规则和已经验证的计算口径,没有变化的部分原样保留,只是重新调整了变化的部分! 它可以在任务过程中动态调整任务计划!! 这个可能是这个版本最大的一个更新!Apodex 1.1 就像是在维护一个持续变化的任务状态: 它要读取真实文件、拆解工作、推进计算,还要接收中途反馈,判断保留仍然成立的成果,只修正受影响的部分,最后把结果交付成可以继续使用和核查的文件。 这可能才是复杂任务型 Agent 真正应该具备的工作能力。 最后,它交付了两份不同粒度的报告,以及一个包含 18 个工作表的 Excel 成本模型;其中专门新增了“变更与场景”“云 API 重算”“本地候选筛选”“本地 TCO 缺失假设”“保留 vs 受影响”5 张表。 整个过程,特别丝滑。 这也是Apodex 1.1这次最核心的变化:进入真实任务的执行过程。 而所谓真实任务的执行,其实就是你随时可以甩给AI新的资料和要求,而它会有条不紊的把任务进行下去,直到交付给你完整可验证的结果!

沐阳

43,632 views • 5 days ago

传统的 Deep Research 已经卷到头了。 能写出一份漂亮的总结报告 ≠ 能把真实的复杂任务干完。 我拿几十万字的《红楼梦》原著,给 Apodex 1.1 在线工作台,出了个极其变态的任务。 统计 20 个核心人物的 → 出场次数 → 出场回数 → 每个人第一次出场时的原句 最后还要整理成一张可以直接下载的完整表格。 整个完成任务的过程,像是直接「雇佣一个 AI 数据团队」。 上传文件后,它自己开始拆任务。 一个 Agent 负责解析原著,另一个独立分析,多个任务并行推进; 右侧 Task Board 会实时告诉你现在做到哪一步。 更有意思的是,任务跑到一半,我突然改需求: “只分析前 80 回,后面的不要了。” 以前遇到这种情况,AI 很可能重新来一遍。 Apodex 直接保留已经完成的成果,只重规划受影响的部分。 更关键的是,它不是做完就交卷。 交付前,又调起独立核验 Agent,把人物统计、出场回数和 900+ 条出场原句重新检查一遍。 最后交付给我的是: 可下载的结构化表格 + 完整分析结果 + 口径说明。 这可能才是下一代 Deep Research 真正值得关注的变化: 从“帮你生成一份报告”,变成“接管一项复杂任务,并把它做完”。 目前,Apodex 1.1 Web 端已经正式上线。 🎁 注册即送 credits,强烈建议立刻上传个复杂文件自己跑跑看: 🌐 没想到,更炸裂的是,Apodex 居然开源了 开源模型: Apodex 1.1 mini,35B,开放模型权重,支持本地部署。 开源框架: FrontierAgent,Agent 执行 Harness,支持 ReAct 单 Agent + Multi-Agent Team。 本地运行: 支持 macOS / Linux,无需强制依赖 Docker。 组合能力: Apodex 1.1 mini + FrontierAgent,可在本地运行完整 Agent 执行流程。 💻 如果你是开发者,这里有开源 Agent 框架,欢迎顺手点个 ⭐: 👉 🤗 想本地自己跑模型的看这里👇 #Apodex #DeepResearch

前端哥Liam

92,119 views • 5 days ago

卧槽,我的MacBook第十款软件终于搞定了! 有了这软件我再也不用天天守电脑了,也是评论区推荐的, 它就是完全免费的远程软件—UU远程, 说实话,一开始我真没把远程控制当回事, 总觉得这东西就是临时救急,看一眼电脑。 结果这两天我在 Mac 上跑 Codex,突然发现不对劲。 AI 写代码不是一下就完事, 它要读项目、改文件、跑测试、等报错、再改。 中间随便一卡,就是十几分钟。 我总不能一直坐电脑前盯着它吧? 那我到底是在用 AI,还是在给 AI 当保安? 所以我干脆把 Mac 放桌上跑任务, 自己拿手机用 UU远程连回去看。 现在桌面上基本是 4 个窗口一起开: Codex 在改代码, 测试在实时跑, Demo 输出在刷新, 状态窗口随时验收。 人走开也没事。 手机上一连回 Mac, 直接问 Codex:现在任务完成到哪了? 测试挂了,就让它继续修; 测试绿了,就看最终输出; 结果对了,当场验收。 这就是UU的终端功能, 可以绕过图形,直接用命令行的形式操作, 改好了直接打开UU远程桌面看结果, 想改的话直接用终端接着改,效率拉满 最关键的是,它现在免费。 不用开会员,也没广告弹窗打断。 这点对我这种刚换 Mac、到处装软件的人太友好了。 早知道 UU远程这么顺手,我前面那些远程工具真不用折腾那么久。 而且它不是只能手机连电脑, 手机、平板、Mac、Windows 都能互连。 远程切窗口、看日志、敲终端,延迟比我想象中低很多。 还有个细节我挺喜欢: 可以开被控端黑屏/静音, 断连后自动锁屏。 人在外面连自己电脑,安全感会强很多。 现在我的新 Mac 基本就是: Mac 在桌上跑, Codex 在里面干活, 我在手机上看进度、补命令、验收结果。 以前远程控制是应急工具, 现在 AI 时代,它反而变成了刚需。

雨哥向前冲

227,402 views • 3 months ago

昨天看很多人转发Apodex 1.1 一个专门面向深度研究而打造的 Agent 专门解决那种"没有现成答案、需要大量调研才能搞定"的硬问题 好奇测试了下,跑了俩任务,一下午都没跑完😅 执行时间是真长 这玩意能你只要给它个目标,它就能能长时间运行、失败后能自动修复,还能自己验证交付结果是否准确 它在接到任务后,主 Agent 拆解成各种子问题,异步派发给专业化的子 Agent执行,每个子 Agent 有自己独立的上下文、提示词和工具集。 子 Agent 的报告汇入共享报告池,编排器异步读取,不会被最慢的那个卡住。单任务最高可调度 150 个子 Agent 解决的是什么问题呢? 过去: 一次提问,一段回答,一份报告。 衡量标准通常是: 答案对不对 知识覆盖够不够 引用多不多 报告写得是否完整 Apodex 想提出的新的要求: 一项从输入到交付的完整任务,衡量标准变成: 是否理解目标 是否能操作真实文件 是否能调用代码和工具 是否能维护长任务状态 遇到变化能否局部调整 执行失败能否自行恢复 最终结论是否可以核查 因此,它真正挑战的是当前 Deep Research 的产品形态: 搜集资料和生成报告,只覆盖了复杂任务的一部分。 真正的专业任务还需要读文件、清洗数据、选择方法、执行代码、处理异常、核查结论。 所以特别适合:科研人员、分析师、专业用户

小互

13,576 views • 5 days ago

今天,把一件关于 AI 很底层的事,彻底想透了。 使用 AI 的最佳方式是以道御术,但前提是你得先以术入道。 就像黄仁勋说的——真正会用 AI 的人,都是极高认知的提问者,带着自己的认知去提问,让 AI 帮你叩开未知的边界,而不是让它替你思考。 这段话最近反复在我脑子里出现, 但我觉得他还少说了一句: 这个认知,到底从哪来? 首先肯定不是看几本书、刷几条推就能来的, 我觉得至少得是你自己上手干过、踩过坑、改过错,这个认知才能慢慢长出来, 这就是以术入道。 就像做菜,你得自己掌过勺,才知道一道菜真正的好坏在哪,AI 也一样,你得先用过、踩过坑、改过错,才能判断它给你的建议到底对不对。 我现在的判断是,AI 工具大概率会分成两条路。 一条是 agent 型,Claude Code、Codex、Hermes 那种,你给个目标它自己跑,你睡觉时它也跑,手机戳一戳继续跑,像一辆自动驾驶汽车。 另一条是 实习生型,典型代表是 Cursor, 每一步都要你判断:diff 改对了吗? 这个建议要不要采用?要不要切 MAX 模型重跑一次? 它有判断力,但没有自主决策权,你不在跟前盯着,它就停下来。 agent 是替你思考,实习生是和你一起思考,而只有后者,才是真正以术入道的过程。 agent 型工具的核心是省时间,你用它做事,实习生型工具的核心是磨判断力,你用它的过程,就是你长出自己那个道的过程。 但实习生型工具有个致命瓶颈——你不在跟前,它就停了。 自从被官方投喂 $10000 额度之后,我现在是个 Cursor 重度用户, 家里专门放了一台 Mac 跑 Cursor, 结果它就变成一个必须我在场才能用的稀缺资源。 直到最近朋友给我推了 UU 远程,网易做的,都免费两年了,而且没广告没会员,一开始我都有点不敢相信。 试了下发现真香,手机一打开就能接进家里那台 Mac,4K 144 帧,几乎感觉不到延迟, 看 Cursor 实时 diff、处理报错、切模型,跟坐电脑前没区别。 最让我惊喜的是,手机能直接开终端, 以前出门想登家里 Mac 跑命令行, 得 Tailscale 再 ssh 再 tmux,折腾半天, 还原生支持一个完整终端,跟敲 zsh 没区别, Cursor 跑一半要 git status、kill 进程、npm install, 手机抬手就办了,特别方便。 更新版本的时候我才发现,UU 远程刚好做到第二年, 周年庆重申不收费,继续打磨产品给大家免费用,还预告了几个新功能:安卓屏幕共享、小窗模式、精细化权限管理、文件夹共享、笔记本设备性能优化。 一个免费做了两年、还在持续往里砸功能的产品,我觉得是真有长期主义、想把产品做好的。 话说回来,AI 发展到这个阶段,我们真正需要的,我理解已经不是更厉害的 AI了,而是一种能让你随时和你的 AI 一起思考的连接方式。 目前看,Cursor和UU 远程这类体验和功能都做的非常丝滑极致的产品, 对我来说就是这个连接方式, 把我和家里那个顶级实习生之间的物理距离消除了, 让我能在任何地方,磨我自己的那个道。 毕竟 AI 工具的尽头,不是替我们做事,是把我们磨成那个,值得被它认真回答的提问者, 以上和大家共勉,一起在学习和使用AI的这条路上,达到以术入道,以道御术的境界。

AYi

695,078 views • 3 months ago

OpenClaw/Clawdbot作者 Peter Steinberger 讲了一个让他顿悟的瞬间。 他给自己的clawdbot发了条语音消息,然后才反应过来:我根本没做语音功能啊。但"正在输入"的指示器亮了。十秒后,agent若无其事地回复了。 Peter问它:你怎么做到的? Agent的回答让他震住了:你发的消息只有一个文件链接,没有扩展名。我查了文件头,发现是Opus格式。用你Mac上的FFmpeg转成Wave。想用Whisper但没装,还报错了。不过我翻了翻发现你环境变量里有OpenAI的key,就用curl调了API拿到转写,然后回复你了。 这个故事的意义在于,这不是预设好的workflow,不是写好的代码,是agent在遇到一个从未见过的问题时,自己想办法把链路串起来。文件头分析、格式转换、找可用工具、翻环境变量、调第三方API,一气呵成。 Peter说了一句话我很认同:这些东西是该死的聪明、足智多谋的野兽,只要你真的赋予它们力量。 "if you actually give them the power"才是关键。大多数人还在用AI写个总结、改个文案,把它当高级搜索引擎用。但当你给它shell权限,给它访问你本地工具链的能力,它展现出的自主探索完成任务能力完全是另一个量级。 与此同时,行业里有一大批人在反方向努力。有人在绞尽脑汁省token,精心设计让AI 更少思考,生怕多花几分钱。还觉得模型做事太慢,自己来设计一些流程替代 AI 的思考探索,美其名曰加速。这种思路本质上是把一个足智多谋的野兽关进笼子里,然后抱怨它不够聪明。 更神奇的是,市面上95%的软件压根就不是为面向智能设计的。还是传统思路:产品经理写PRD,开发者把逻辑一条条写死在代码里,用户只能在预设的按钮和流程里点来点去。这些软件在AI时代就像是用打孔纸带写程序,技术上能用,但完全错过了这个时代真正的可能性。 --- 注,这段切片是我丢下一句话给 claude code 完成的下载切片添加字幕,只是提出要求,没有任何 Skills,没有告诉他怎么做。

kAI

171,400 views • 7 months ago

自从马云重新现身后, 蚂蚁集团一直猛冲AI,大动作不断! 像是卯足劲在追赶阿里QWEN! 最近更是连发两款实用拉满的模型!!! 先是百B级的 Ling 2.6 Flash, 盲测阶段就冲上 OpenRouter 趋势榜第一, 直接火到了海外!! 还不算完,Ant Ling 今天又甩出一张底牌: Ling 2.6 1T ! 名字就能看得出来,这个模型能力会更强!! 但有一个误区:能力强的不一定是思考模型! Ling 2.6 1T 不靠拉长推理链条来显得"很聪明", 而是把 token 更多花在理解、规划和输出上。 换句话来说: 它的核心定位,是面向复杂任务,是精准指令下的执行模型!! 1M 超长上下文,能把会议纪要、群聊记录、项目文档、零散资料一次性扔进去统一处理。 强工具调用能力,可以接进 OpenClaw、Hermes、LangGraph、Dify 等跑工作流。 真实问题处理,不只生成漂亮 demo,而是能够读懂已有代码,按照你的要求去干活。 Token 效率更高,不默认展开超长思考,成本控制到最低。 最近一段时间都是免费用,不用白不用, 我拿了几个真实任务跑了一遍,感受超级明显—— 如果是模糊的指令,它可能不太适合。 但如果是比较详细的指令,给它一个工作流, 就完全起飞了!! 没有了推理过程,感觉非常丝滑, 这一点,就挺重要的!! 减少了很多“AI自作聪明”的麻烦!! 说回蚂蚁这两款模型, 完全是冲着落地应用来的,几乎把简单和复杂的应用场景全部包圆。 1T 负责理解复杂目标、拆解任务、整理材料、制定计划。 Flash 负责快速执行、快速改写、快速补全。 这精准切入了现在大多数人用AI的“痒点”: 总想着用一个“最强模型”解决所有的事情。 但我认为真正重要并且正确的是: 让对的模型干对的事。 这样无论是速度、成本、还是结果一致性,都更能符合预期。

沐阳

116,421 views • 4 months ago

06大学生(大专生)第一个企业项目 本项目使用的是codex+Claude+hermes修改的过程中几乎是用codex和hermes。项目最开始的时候是先把公司那边的需求传给Claude code进行需求分享和框架搭建,然后中期是使用的codex进行ui设计,执行任务和计划,包括一些功能的测试和验证,最好完成阶段是使用的hermes进行全部功能测试,然后后面还进行了十几次修改调整也是使用的hermes进行修改验证,改一个功能就验证一下,然后再部署到云端服务器上面,循环。 因为有的地方有项目方的名字还有域名那些就没有展示,帮一个企业做的,大概就是做成了现在这样,上上周就是上一次跟公司的老板在学校里面当面谈了一会,当时说是很满意,说了一些地方需要修改和调整,你们觉得有没有什么问题啊,我现在是在自己的阿里云服务器上面跑的,后面的话再迁移部署到他们公司的服务器,但是现在还没有谈交付和收费怎么弄?比如是一次买定还是租用,还有后期的维护和后续修改的费用,部署需要收费吗?不知道怎么定价,那个公司的老板是我一个老师的朋友🤔🤔🤔 图二是新的老板,额,一个GitHub大佬推荐的,挺漂亮 说是要做一个支付宝的小程序,但是现在还没有说具体的需求🤔🤔🤔应该这几天会说。做之前一定要先谈清楚怎么分阶段交付?怎么算完成?然后根据难度和花费的时间去计费,这是这次项目的目标,也是对自己的一种锻炼吧🫡🫡🫡加油

阿金

27,597 views • 2 months ago

最近当大家都在刷屏Fable 5和GPT-5.6 的时候, 殊不知腾讯已经悄无声息的把大模型能力给追上来了。 你们知道腾讯低调到什么程度吗? 前几天发布的Hy3 ,21B的激活参数已经可以打平旗舰水准,并且直接塞进微信10 亿+用户手里 , 这才是国产大模型真正的王炸啊兄弟们! 说实话周一刷到 Hy3 发布消息那会儿, 我第一反应跟很多人一样:又一个卷参数的国产模型? 趁着周末有空,我仔细翻了一圈资料, 发现完全不是这么回事。 原来Tencent Hy这个模型从一开始就不是朝着聊天模型去的,人家的定位就是奔着干活去的 Agent 向 LLM。 另外最反直觉的是它的推理效率,295B 总参数, 实际激活只有 21B 的 MoE 架构, 就能打平参数是它 2 到 5 倍的旗舰模型, 这事儿我琢磨了一下,其实有点像团队管理, 并不是说人越多产出越高, 关键得看真正干活的那几个人靠不靠谱。 为什么这个效率重要呢? 你想想微信每天服务 10 亿人, token 成本多一厘都是天文数字, 21B 激活还能打出旗舰水准, 我觉得这才是它能被规模化铺开的根本原因, 跟刷榜没半毛钱关系。 说到刷榜,我仔细研究之后这个版本还真不是, 从 preview 到正式版,Hy3 是Hunyuan团队拿了50 多个真实业务的反馈不断迭代出来的,内部 WorkBuddy 任务成功率从 72% 干到 90%,耗时降了 34%,幻觉和常识错误全往下掉。 我原来以为 Agent 的核心是想得多深, 后来发现真正决定能不能上生产的,是稳不稳, 比如工具编排会不会中途崩,出错了能不能自己爬回来,换个框架差不差太多等等, 就是这些不起眼的东西, 才是能跑完一整套 workflow 不掉链子的关键。 当然实际测试下来Hy3 也有短板, 比如纯视觉它还不够强,不过腾讯也有单独的多模态大模型线,它能打的主要还是 coding、办公、复杂任务规划这几块。 最后说个我的一个判断:就是接下来大模型拼的可能不是谁参数更大了,核心看谁能把干活的能力以最低摩擦送到更多人手里,比如Hy3 我理解它可能不是一个更会聊天的模型,更像是一个更会干活的 Agent 底座。 话说回来,腾讯这步棋确实走得挺狠, 我觉得国产大模型的拐点真的要到了, 下方视频是我用Hy3跑的几个测试案例, 分别让它做了一个介绍自己的HTML网页, 一个我的认知系统agent网页, 和做了一个10页的PPT,都很惊艳,大家可以感受下, 会干活、会自检、还会主动说自己哪没做到位, 我觉得这才是 Agent 时代,真正能用的模型该有的样子hh~ #Hy3 #Hunyuan #TencentAI

AYi

194,015 views • 1 month ago

最近和同事吃饭,她提到小孩学校发了一个小学生编程比赛的通知。 她觉得编程太难,直接放弃了。全班也没有一个人参加。她说,这类通知发下去,基本没什么声音。 我听完冒出一个想法。少儿 AI 编程也许可以试试。 我把这个问题交给 Apodex,让它研究家长需求、竞品、成本和教育效果。 任务跑起来后,我又补了几次条件。我是一个从零开始的 Vibe Coder,预算只有 3000 元,每周最多投入 20 小时,也没有教师和家长资源。我还补充了家长可能的担心孩子用了 AI 以后,只会复制答案,不再自己思考。 Apodex 这次让我感到与传统 Deep Research明显的差别,是它把调研拆成任务板上的具体分工。 几个 sub-agent 分头查需求、竞品、成本和研究证据,条件变化以后,任务板继续更新,交付前还有一个 final_verifier 复核报告。整个过程像在跟一个小型研究团队协作,报告是最后的交付。 最终报告给出的判断很直接。以我的预算和时间,直接做 App 的失败模式太多,先做一个小型 MVP 课程,再用 30 天验证家长是否愿意付费,更现实。 更值得一提的是,它还给出了家长访谈、最小测试方案和停止条件。招不到付费家庭、孩子留存太差,或者合规走不通,就停下来。 这份调研它帮我把一个模糊想法变成了一次可以开始,也可以及时停掉的小测试。 以前有个新想法,我很容易直接打开AI coding,先把页面做出来。页面能跑,需求有没有人买单却还不知道。 这次我换了一下顺序。先搞清楚值不值得做,再开始 Vibe Coding。 这也是我对 Apodex 所说的“把任务做完”最直观的一次理解。 想拿自己的真实任务试一遍,可以直接使用 想看它背后的开源 Agent Harness,可以去 点个 Star。 Apodex 1.1 mini 的模型权重放在

苏打白.Dev

22,721 views • 5 days ago