Загрузка видео...

Не удалось загрузить видео

На главную

以前一直觉得 AI Coding 拼的是模型聪不聪明,现在反而越来越觉得,真正影响开发体验的是一个成本可控、速度快、指令遵循稳定的执行节点。 所以体验 Ling-3.0-flash 时,我特意按照官方推荐的 AI Pair Programming(AI 结对编程) 来试了一次。 我选的是一个相对经典的案例网页端 Pixel Art(像素画)编辑器。 整个过程,我没有让它直接生成完整项目,而是先自己把边界定义好: ·TypeScript + Vite ·单页应用 ·支持镜像绘制 ·Undo / Redo ·PNG 导入导出 ·Tile Preview(平铺预览) 剩下的交给 Ling-3.0-flash。 第一步:先搭框架,而不是直接写功能 它没有像很多模型一样把所有代码塞进一个文件,而是很自然地拆成了 Canvas、History、Mirror、Toolbar 等模块。 这一点让我挺意外,因为后面不断增加功能时,每次修改几乎都能定位到对应模块,而不是整份代码重写。 这也是 Pair Programming 和 One-shot 最大的区别,人负责决定怎么做,AI负责把它实现出来。 第二步:一边开发,一边改需求 框架出来之后,我开始不断改需求。 第一次,我让它增加镜像绘制,没多久功能就完成了。 随后我又继续提出新的要求镜像模式支持四向对称、左右堆成、上下对称,它没有推翻之前的逻辑,而是在已有代码基础上继续扩展。 接着我又增加了 Undo / Redo、随机画图,然后再加入...

137,237 просмотров • 18 дней назад •via X (Twitter)

Комментарии: 0

Нет доступных комментариев

Здесь появятся комментарии из оригинального поста

Похожие видео

蚂蚁百灵刚刚发布了 Ling-3.0-flash: 一个AI 执行层的关键拼图 刚刚看到 Ling-3.0-flash 正式发布,我觉得这款模型值得认真关注。原因很简单:在 AI 工程越来越深入到实际业务的今天,大家早就不满足于模型“会不会想”了,更关键的是它“能不能持续做”。 尤其是在 Agent 工作流中,需要高频调用工具、迭代代码、处理长程任务时,一个响应快、执行稳的执行引擎成了刚需。Ling-3.0-flash 的出现,正好瞄准了这个缺口。 1. Agent 的执行层 从我的角度看,它最聪明的一点是没有去硬拼超大模型的深度推理能力,而是把自己定位成一个高速执行引擎——负责把已经规划好的任务快速落地。 这在实际应用中特别实用,比如当大模型把方案设计好之后,剩下的代码生成、工具调用、批量处理就需要一个既快又稳的模型来接手。 2. 为什么它能兼顾速度和成本 技术细节上,它采用 124B 参数的 MoE 架构,但实际激活参数约 5.1B,在推理速度和运行成本之间找平衡。 它还支持混合推理模式:简单任务可以关闭 Reasoning,降低延迟,适合大批量处理;复杂任务则可以开启思考模式,保持逻辑连贯。 原生支持 256K 上下文,对需要持续读取历史指令和项目状态的 Agent 工作流也很重要。 3.如何使用 我觉得 Ling-3.0-flash 最适合做 Agent 工作流里的执行节点。反复调用 API 或 MCP 工具时,它能根据结构化错误信息自我诊断和修复,不容易在循环调试中卡死,因此适合放进 Loop 或 Graph 架构。 4.结对编程和批量任务 结对编程是一个典型场景:人负责架构规划、边界定义和测试,Ling-3.0-flash 负责快速生成代码、调用工具、读取报错,并根据反馈持续修改。 批量处理长文档、日志、简历和结构化数据时,它看重的也是速度、格式稳定性和成本控制。直播数字人或高频办公协作,则需要它的低延迟响应来减少体验断层。 5.边界 当然,它不是万能模型。复杂系统不能只靠一句指令搞定;缺乏架构和测试环境时,结果可能跑偏;需要深度冷门知识的研究任务,还是更适合交给更大规模的推理模型。 更合理的用法是:大模型负责搜索、规划和架构设计,把方案写成规范文档;Ling-3.0-flash 负责高频工具调用、代码执行和批量处理。 总结:Ling-3.0-flash 不是来替代所有模型的,而是把 Agent 工作流里“执行层”这件事做得更快、更稳。大模型负责想清楚,它负责做出来。

奶牛叔

65,993 просмотров • 17 дней назад

🚨Stitch 这次升级不得了,我觉得重点不是多了几个功能,而是 Google 正在重写 AI 设计工具的定义。 1/ Google 昨晚更新了 Stitch,官方给它的新定位很直接: AI-native software design canvas。 2/ 翻译成人话就是: 它不想只做一个 “你写一句 prompt,我给你几张 UI 图” 的工具了。 3/ 这次更新,核心就 5 个方向: 无限画布 更聪明的设计代理 语音交互 即时原型 设计系统 + DESIGN.md 4/ 最值得看的第一点,是 AI 原生画布。 现在的 Stitch 不只是吃 prompt。 还可以把 图片、文本、代码 一起作为上下文。 这说明它开始更像“设计工作台”,而不是一次性生成器。 5/ 第二点,是 agent 变强了。 Google 这次明确说,新 design agent 能理解整个项目演进过程,而且还有 Agent manager,支持你并行探索多个设计方向。 6/ 第三点,是 语音进入设计主流程。 你可以直接对着画布说话 让 Stitch 一边听一边改 还能给你实时设计反馈 7/ 第四点,是 即时原型。 现在 Stitch 可以把静态设计快速变成交互原型,点一下 Play 就能看 flow,甚至还能自动补出逻辑上的下一屏。 8/ 第五点,是很多人会低估的 DESIGN.md。 Google 把设计规则做成了一个 agent-friendly markdown,支持导入、导出、复用,还支持从 URL 提取设计系统。 9/ 所以这次 Stitch 真正从“帮你出图”,走向“参与整个设计流程”。 10/ 一句话总结: 2025 年的 Stitch,更像 UI 生成器。 2026 年这次升级之后,它开始更像 AI 设计工作台。

比特币橙子Trader

16,604 просмотров • 4 месяцев назад

我第一次用 Ling 3.0 flash,做的只是一个很基础的任务,整理50条用户评论。 评论来自不同用户,内容很杂。有 bug 报告,有功能请求,也有对整体体验的评价。 过去处理这类材料,我得一条条读,再手动归类重复问题,统计出现频率,最后才能开始写汇总报告。这个过程不难,却很耗时间,也很容易漏掉信息。 ## 把重复劳动交给模型 这次我把全部反馈一次性发给 Ling 3.0 flash,同时给了它一套更清楚的处理流程。 它需要完成的事情包括。 - 对评论按主题分类。 - 提取每条反馈里的核心信息。 - 合并重复或高度相似的建议。 - 去掉无关和冗余内容。 - 输出一份可直接查看的汇总报告。 几分钟后,结果就出来了,结构很清楚,查看起来也很省力。 像记录问题,增加深色模式,一次性导出多条消息这类反复出现的建议,都被归到了一起。不同类别的反馈也完成了统计,哪些问题出现得更多,一眼就能看出来。 ## 模型负责产出,人负责判断 这件事帮我省下来的,不只是阅读五十条评论的时间。 我不需要反复检查有没有遗漏,也不用重新核算相似评论,更少了很多手动整理时容易发生的小错误。 模型没有替我决定产品该怎么做,它只是把杂乱的信息整理成了我能判断的材料。 产品要不要做深色模式,导出功能该排在什么优先级,bug 修复要投入多少资源,这些决定依然要由人来做。 我觉得这才是更接近真实工作场景的 AI 用法。人掌握目标,规则和最终决策,模型承担整理,归纳,格式化和生成这些执行工作。 ## 很多办公任务,不需要顶级推理 不少办公场景并不缺复杂思考,真正缺的是稳定完成重复任务的能力。 日常工作里,经常会遇到这些事情。 - 阅读一批文档。 - 汇总不同来源的材料。 - 统一格式。 - 按既定规则分类。 - 生成可以直接交付的内容。 这类流程每天可能发生很多次。它们不一定需要一个负责规划全局,决定方向的模型,却很需要一个响应快,输出稳,能按要求执行的工具。 Ling 3.0 flash 给我的感觉,更像项目流程里可靠的执行环节,而不是替代负责人做判断的控制中心。 只要我把目标和流程交代清楚,它就能更快完成后续步骤。我也能把时间留给更需要批判性思考,沟通协调和决策判断的事情。 并不是每个问题都要动用最强的推理能力。把高频,重复,规则明确的流程交给更快更稳定的模型处理,往往才是效率真正提升的地方。 体验地址: 👇以下视频 是我亲自体验录制的过程

拳头👊🕊️

14,330 просмотров • 16 дней назад

Claude Opus 4.8 出了之后,我的第一反应是:想试。 第二反应是:算了,token 这东西真的不经烧。 结果看到 ZenMux 现在可以体验 Opus 4.8,就拿它试了一个我最近一直想做的小东西。 我自己有个很真实的问题: 脑子里经常冒出各种产品想法。 但每次真要开始做,就会卡住。 用户是谁? 第一版到底做什么? 哪些功能应该先砍掉? 怎么定价? 第一周从哪一步开始? 上线后怎么找第一批用户? 想法很多,执行很散。 所以我让 Claude Opus 4.8 做了一个「一人公司作战室」。 需求我写得也挺直接: 输入一句产品 idea。 自动拆出产品定位、MVP、开发任务、定价方案。 再生成落地页文案、冷启动实验、风险清单和本周计划。 最好不是一个静态页面,而是真的能点、能改、能导出。 然后我就把这段话丢给 Claude Opus 4.8。 出来的效果比我预期好不少。 它真的把“一人公司怎么从想法走到执行”这件事拆开了。 左边输入产品想法。 中间生成产品蓝图、MVP 范围、定价和官网文案。 右边是任务看板和本周计划。 底部还有冷启动实验、风险雷达和 Markdown 导出。 最让我觉得有意思的是,它不是一味堆功能。 比如我输入“给小红书博主做 AI 选题助手”,它会主动判断: 第一版必须做什么。 哪些功能看起来高级,但现在应该先别碰。 怎么找第一批真实用户。 哪些风险可能让这个项目做不下去。 这点就很能体现 Opus 4.8 的能力。 普通模型经常是:你要什么,我全给你加上。 最后页面很热闹,但产品判断是空的。 Opus 4.8 更像是在帮你收敛:先想清楚用户、场景和第一步,再把它变成可以执行的工作台。 我是在 ZenMux 上试的。 它比较方便的一点是,一个 Key 就能切不同模型,新模型上线也很快。 Opus 4.8 拿来做这种带产品判断、交互状态和复杂信息结构的网页,确实挺顺。 想试 Claude Opus 4.8 的,可以从这里进:

Joruno

15,983 просмотров • 2 месяцев назад

Ring-2.6-1T 开源了。 我最近试下来,这个模型各方面的能力都很不错,但最喜欢的一点,是它在前端 Web 页面上的审美和交互能力真的很强。 我随手让它做了一个宠物零食独立站前端,提示词其实没写多细,也没给什么复杂设计规范。结果出来之后有点惊喜:页面不是那种常见的 AI 模板感,而是真的像一个可以上线预览的品牌站。 它会自己理解“宠物零食”应该是什么气质:干净、温暖、有食欲,但又不是一味可爱。产品展示、视觉层级、按钮状态、动效节奏、页面留白,都处理得很完整。尤其是交互,不是静态摆拍,而是有浏览、有筛选、有点击反馈,像一个真正给用户逛的站。 这也是我觉得 Ring-2.6-1T 很不一样的地方。 很多模型能写页面,但写出来像“代码完成了”。Ring-2.6-1T 更像是知道一个网页应该如何被观看、被点击、被感知。它懂风格,懂交互,也懂怎么把第一版里不顺的地方继续修到更自然。 所以如果你要做高质感展示页、品牌概念站、数据可视化页面,或者 creative coding 演示,我觉得它很值得试。 不是因为它能写 HTML。 而是它真的能把一个很粗的想法,推成一个有审美、有质感、有交互的前端作品,还很快。 我把 Ring-2.6-1T制作过程放评论区了,全程没加速。

阿川 | AI thinking

15,263 просмотров • 2 месяцев назад

OpenAI刚刚开源的这个东西,感觉要把程序员的工作方式给整个改写了。 现在大家都在卷模型写代码有多强,但其实真正的瓶颈早就不是生成了。 一个人每天最多同时有效监督3-5个编码Agent,再多就会注意力崩溃,生产力直接归零。 有了Symphony,直接把这个上限干到了几十个。 它把你的Linear、GitHub Issues直接变成了永远在线的Agent调度器。 你开一个任务,它自动启动一个独立隔离的Codex Agent。 自己写代码,自己跑测试,自己做交叉Review,damn! 全部搞定之后,会给你提交一个完整的证据包。 CI全绿,安全和性能专项审查通过,改了UI就自动录好操作视频。 所有验证全过了,才会出现在你的Human Review队列里。 以后人类的角色可能会被彻底颠覆了。 以前你是监工,盯着Agent一步一步写代码,上下文切到吐。 现在你是老板,只需要看最终的结果。 满意就点合并,不满意就去仓库里补规则补文档补Guardrails。 记住兄弟们,永远不要手把手指挥Agent,永远不要替它干活。 这可不是啥实验室概念,OpenAI自己已经这么干了。 三个工程师,五个月,写了一百万行代码,0行人工写的。 产品已经有几百个内部用户,每天都在迭代。 我觉得他们最厉害的不是模型,是他们把整个仓库变成了Agent能看懂能自主工作的乐园。 现在很多人都搞错了Agent时代的核心竞争力。未来不是谁的模型更聪明,而是看谁能设计出让Agent可靠自主工作的环境。 我觉得未来最好的工程师,再也不是写代码最快的人,而是那些最会写规则,最会设计反馈回路,最会给Agent搭舞台的人。 现在Symphony已经开源了,它甚至不是一个成品。 是一个17k token的完整SPEC。 你把这个SPEC喂给任何一个编码Agent,十分钟就能生成你自己定制版的Symphony。 GitHub地址评论区自取👇

AYi

63,210 просмотров • 3 месяцев назад

这两年我一直有个默认假设:模型参数越大,能力越强,什么任务都该交给最大的那个模型去做。但最近我在搭一个需要长流程、反复调用工具的 Agent 任务时,专门试了试把"规划"和"执行"拆开、交给不同模型来做的思路,用的执行端模型是Ant Ling刚发布的 Ling-3.0-flash。这次体验让我对"大模型不是越大越好"这句话有了更具体的理解。 我遇到的问题 起因是我想搭一个 Blender MCP 的工作流:让 AI 帮我自动完成一个简单场景的粗模搭建和运镜——比如摆几把椅子、设置一个摄像机轨迹,作为后续正式渲染前的预演草稿。 一开始我图省事,直接让一个参数量很大的全能模型来处理整个流程:既要它想清楚场景该怎么布局、镜头该怎么运动,又要它高频地调用 Blender 的 MCP 接口去逐步执行动作。 结果是,虽然效果还行,但每一步操作等待的时间都不短,跑完一整套流程花的时间和成本都超出了我的预期——毕竟这类任务里,真正需要"深度思考"的部分只占很小一块,绝大多数时间都花在了"调用接口、摆放物体"这类重复动作上。 换成"规划-执行分离"之后 我把流程拆成了两段:先用一个知识面更广的大模型,把场景的整体构图、镜头运动路径想清楚,写成一份结构化的操作说明;然后把这份说明交给 Ling-3.0-flash,让它作为执行引擎,逐条读取说明并调用 Blender MCP 接口去落地。 这一次的差别很明显。Ling-3.0-flash 的总参数量是 124B,但实际推理时只激活 5.1B 参数,加上首字延迟能做到 500 毫秒以内,我能感觉到每一步操作的响应几乎是"秒回"的——不再是那种等大模型"想"完再动手的节奏,而是我一条指令下去,场景里的物体几乎立刻就摆好了。整套流程跑下来,成本也比全用大模型的方案低了不少。 我的体会 这次尝试让我确认了一件事:如果任务里"想清楚该怎么做"和"把已经想清楚的事情执行出来"这两部分能拆开,那把执行这一段交给 Ling-3.0-flash 这类专门优化过工具调用稳定性和响应速度的模型,确实比一个模型包办到底更划算。 但我也发现,这套分工不是无脑套用的——如果场景本身很复杂,需要边搭建边做美学判断(比如构图是否好看、光影是否协调),单靠 Ling-3.0-flash 自己去决定,效果就会打折扣,这部分还是得靠前期规划阶段先想清楚。 人负责把边界和验收标准定好,大模型负责规划,Ling-3.0-flash 负责又快又稳地把方案落地——这套组合让我第一次比较直观地感受到"规划-执行分离"这套架构的实际好处。 目前Ling-3.0-flash 现已在 OpenRouter 上线——并可免费使用至 2026 年 8 月 3 日。 链接: 也可以直接网页对话体验: 大家不妨去体验体验一下,感受下魅力

韭菜饼子

83,215 просмотров • 16 дней назад

星爷讽刺了世间一切,唯独没有讽刺爱情,: 原来是如此的隐喻,到现在才明白,感谢星爷,只是我们弄脏了爱情。 —— 我之前一直对 zkML 有点矛盾。 逻辑上它很美:模型是对的,而且你还能证明它是对的。 但每次真去看实现,基本都会卡在同一个地方——跑不起来。 不是“慢一点”,而是那种一看资源占用就知道不可能进生产的跑不起来。 模型稍微大点,电路直接失控,内存、时间全都爆表, 最后只能留在论文和 demo 里自嗨。 所以我第一次认真看 Inference Labs 的时候,关注点反而不在“zk”, 而在他们是不是愿意承认:这玩意本质是工程问题。 DSperse 给我的感觉,就是终于有人不再执念“一次性证明整个模型”。 模型切开、并行跑、只验证关键路径, 听起来很朴素,但恰恰是工程师会选的路。 不是最优雅,但能活。 JSTprove 则更现实。 你不需要懂零知识、也不用研究电路怎么写, 把 ONNX 模型丢进去,能转、能跑、能验, 这点其实比很多“性能提升 10%”更重要。 这两块拼在一起之后,zkML 才第一次让我觉得: 它不是在证明“我可以”, 而是在回答“你要不要真用”。 对我来说,zkML 的拐点从来不是密码学突破, 而是有没有人愿意为“跑得起来”妥协设计。 Inference Labs 看起来,至少选了这一边。 懂你意思了,这版我会刻意留下不完美、主观判断和情绪停顿,像是你自己琢磨出来的,而不是“写给别人看的技术解读”。 —— 我之前一直对 zkML 有点矛盾。 逻辑上它很美:模型是对的,而且你还能证明它是对的。 但每次真去看实现,基本都会卡在同一个地方——跑不起来。 不是“慢一点”,而是那种一看资源占用就知道不可能进生产的跑不起来。 模型稍微大点,电路直接失控,内存、时间全都爆表, 最后只能留在论文和 demo 里自嗨。 所以我第一次认真看 Inference Labs 的时候,关注点反而不在“zk”, 而在他们是不是愿意承认:这玩意本质是工程问题。 DSperse 给我的感觉,就是终于有人不再执念“一次性证明整个模型”。 模型切开、并行跑、只验证关键路径, 听起来很朴素,但恰恰是工程师会选的路。 不是最优雅,但能活。 JSTprove 则更现实。 你不需要懂零知识、也不用研究电路怎么写, 把 ONNX 模型丢进去,能转、能跑、能验, 这点其实比很多“性能提升 10%”更重要。 这两块拼在一起之后,zkML 才第一次让我觉得: 它不是在证明“我可以”, 而是在回答“你要不要真用”。 对我来说,zkML 的拐点从来不是密码学突破, 而是有没有人愿意为“跑得起来”妥协设计。 Inference Labs 看起来,至少选了这一边。懂你意思了,这版我会刻意留下不完美、主观判断和情绪停顿,像是你自己琢磨出来的,而不是“写给别人看的技术解读”。 —— 我之前一直对 zkML 有点矛盾。 逻辑上它很美:模型是对的,而且你还能证明它是对的。 但每次真去看实现,基本都会卡在同一个地方——跑不起来。 不是“慢一点”,而是那种一看资源占用就知道不可能进生产的跑不起来。 模型稍微大点,电路直接失控,内存、时间全都爆表, 最后只能留在论文和 demo 里自嗨。 所以我第一次认真看 Inference Labs 的时候,关注点反而不在“zk”, 而在他们是不是愿意承认:这玩意本质是工程问题。 DSperse 给我的感觉,就是终于有人不再执念“一次性证明整个模型”。 模型切开、并行跑、只验证关键路径, 听起来很朴素,但恰恰是工程师会选的路。 不是最优雅,但能活。 JSTprove 则更现实。 你不需要懂零知识、也不用研究电路怎么写, 把 ONNX 模型丢进去,能转、能跑、能验, 这点其实比很多“性能提升 10%”更重要。 这两块拼在一起之后,zkML 才第一次让我觉得: 它不是在证明“我可以”, 而是在回答“你要不要真用”。 对我来说,zkML 的拐点从来不是密码学突破, 而是有没有人愿意为“跑得起来”妥协设计。 Inference Labs 看起来,至少选了这一边。#KaitoYap Kaito AI 🌊 #Yap Inference Labs

董小姐 |上Gate玩事件合约

36,252 просмотров • 7 месяцев назад

埃隆·马斯克断言: 编码将在今年彻底死亡。不是“进化”。是死亡。 到今年12月,AI 将不再需要任何编程语言。它直接吐出机器码——那种二进制优化程度,远超人类逻辑所能触及的极限,没有翻译层,没有编译步骤,只有纯粹的、赤裸的执行。 马斯克原话:“你甚至都不用再费心去写代码。”代码从来就不是目的。它只是摩擦,是我们被迫支付的“人类税”——因为机器不懂人话。现在,AI 已经学会了流利的人类语言,这笔税,彻底取消了。再把这一切接入 Neuralink:没有语法,没有键盘,没有屏幕。 马斯克:“从想象直接到软件。”一个念头,就能变成可执行代码。你脑海中浮现一个结果,系统瞬间为你架构、优化、编译成现实。我们不是在“自动化编程”。我们是在把编程这个概念从宇宙中抹除。整个职业瞬间坍塌成一个念头。几十年的训练、无数行代码、无数个通宵——瞬间变得毫无意义。从“idea”到“成品”的距离,归零。你不再“构建”。你只需“想象”,它就具现。这不是渐进式进步。这是彻底的相变。人类一万年来“创造”的方式,在这一刻过时了。欢迎来到新世界。在这里,限制你的不再是技能、资源、时间…… 而是你能不能足够清晰地“看见”你想要的东西——然后让机器把它生出来。 我认为事情实际上可能会在今年年底之前就发生转变,到时候你甚至都不用再费心去写代码了。AI 会直接生成二进制代码,而且它生成的二进制会比任何现有编译器优化得更高效。所以你只需要说:“针对这个特定结果,生成最优化的二进制代码。”——这样就直接绕过了传统编码流程。 没错,这其实只是一个中间步骤,但我估计到今年年底,这个步骤很可能就彻底不需要了。

🌹MIDNIGHT🌹ROSE🌹

99,266 просмотров • 6 месяцев назад

如果你会清理C盘垃圾,你将是公司的“电脑专家”! 如果你会做一个简单好用、并且没有广告的垃圾清理小工具,那你将是所有女同事心中的“IT之神”!! WIN系统电脑的清理工具其实很多,我用最多的是一些大神从大厂软件里剥离出来的“绿色单文件版”,只保留垃圾清理这一个功能!足够轻量简单! 为了在女同事面前露一手,突发奇想干脆自己做了一个和我同名的C 盘清理桌面小工具。 界面尽量简单,没有广告,也不去塞一堆看不懂的“高级功能”。 但Codex额度没了!! 于是我打开了OpenCode ,在OpenRouter上翻了好一阵牌子,最后选了蚂蚁 Ant Ling 新发的Ling-3.0-flash!! 蚂蚁最近动作太频繁了,正好也试一试这个新模型!! 我把需求拆成了几步,UI、清理引擎、扫描测试分阶段执行,让它持续读取项目、修改代码、运行程序,再根据实际结果继续调整。 结果还真是出乎意料,整体给我的感觉很快,而且很有章法! 不是“一句话就生成完整软件”,每一步都是动态的, 我负责确定功能、边界和安全规则,它负责高频写代码、执行修改和处理反馈。 还别说,这种flash模型真的很适合干这种需求明确,工程不算复杂的任务! 就是不知道后面官方会怎么定价,按照蚂蚁的习惯,应该很快会开源的!!

沐阳

16,565 просмотров • 16 дней назад

来自 Claude Code 团队成员 Thariq 分享的用好 Fable 5模型的秘诀。 以下内容整理自 Thariq 的视频: 过去,我们需要时刻检查 Claude 是否在正确地做事。比如,把任务拆分成小块交给它、反复检查它的输出,并在它过早停下时发现问题。但有了 Claude Fable 5,我反而发现自己越来越多地是在检查 Claude 是否在做正确的工作。 Fable 可以一次运行几个小时,它会测试自己的工作,老实说,我经常发现它写出的代码比我的还要好。我的工作变得越来越侧重于指引方向和前期设置,而不是监督。因此,以下是我在使用 Fable 时,工作方式发生的三个改变。 首先,我把 Claude 当作一个思维伙伴。我给它提供所需的上下文。其次,我给 Claude 设定目标并提供验证这些目标的方法。最后,我试着变得更有野心,让 Claude 去做我以前从未尝试过的事情。 第一点,你要越来越多地把 Claude 视为一个思维伙伴。 我在使用 Fable 时发现的一个失败模式是,我可能实际上并不知道自己想要什么,或者我可能不知道什么是可行的。但是,在我的思考过程中尽早让 Claude 参与进来,我就可以在实施之前发现这些问题。 举个例子,我会先从一个小的需求规范(spec)开始,在编写最终的规范文件之前,我会要求 Claude 就实施方案对我进行“面试提问”。这有助于我建立信心,确信自己知道想要什么。或者,我也可能抛出一个想法,让它想出几个可以发展的方向,并制作一些 HTML 页面原型供我审查。 当我准备好进行实施时,我会尽量给它提供上下文,而不仅仅是约束条件,这样 Claude 就能真正帮助我达成目标。 例如,我不会说“保持简单,不要过度设计”,而是会说:“嘿,这个功能是个实验。我们很有可能在一个月后删掉它。所以不要构建任何丢弃起来会很心疼的东西。”给它这样的上下文,能让它发现你可能都没想到的事情。 一旦你知道自己想要什么了,特别是面对一个雄心勃勃的难题时,考虑给 Claude 设定目标以及验证目标的方法。 为此,我们推出了两个很好用的新功能,我也鼓励大家试一试:/goal(目标指令)和 workflows(工作流)。目标功能帮助 Claude 持续工作直至完成,而工作流则帮助 Claude 验证其工作。 因此,在我写完规范文档后,我可能会告诉 Claude:“设定一个目标,以完整实现该规范。然后使用工作流来验证计划的每个部分,并准备一份报告,说明已实现了哪些内容以及是否有任何差异。”这让 Claude 能够尽可能以富有创意和周到的方式发挥其能力,同时又能确保它正在构建你想要的东西。 最后,试着更有野心一些。 Fable 真的是一个令人难以置信的模型,它促使我在工作中打破常规去思考。例如,我正在用 Fable 剪辑这个视频。如果有什么事情是你以为大语言模型做不到的,给它个机会试试。我们由衷地认为,Fable 提高了“一切皆有可能”的上限。

宝玉

143,276 просмотров • 1 месяц назад

【Vibe Coding 实战心法】为什么你的 AI 搞不定 Polymarket 套利?揭秘跨模型“组合拳”开发流! 告别死磕,掌握这套 AI 协作流,让 0 基础编程效率翻倍 最近很多同学私信我,问得最多的一个问题就是:“我也想搞 Polymarket 的自动套利,思路都有了,但让 AI 写代码时总是报错,改来改去还是跑不通,是不是我不适合干这个?” 说实话,不是你不适合,而是你“打开方式”不对。 今天我就把压箱底的经验拿出来,简单给大家避个坑。这不仅适用于 Polymarket,也适用于任何你觉得“AI 搞不定”的复杂项目。 一、 认清现实:AI 模型也是“偏科生” 首先,大家要有一个认知:目前的 AI 模型水平参差不齐,且各有所长。 有的擅长逻辑推理(像数学教授); 有的擅长快速生成模板(像熟练工); 有的擅长创意交互(像设计师)。 当你盯着一个 AI(比如只用 ChatGPT 或只用 Cursor 默认模型)死磕一个报错,就像是逼着体育老师教高数。如果一个问题你让 AI 尝试了 3 次以上还无法解决,立刻停手!不要死磕! 解决方案是:换人(换模型),或者换脑子(找外援)。 二、 核心策略:跨平台“组合拳” (The Cross-Platform Flow) 既然单一模型搞不定,我们就要学会像“包工头”一样指挥不同的 AI 协同工作。 我目前的Vibe Coding 黄金工作流是这样的,每一个环节都有明确的目的: 🟢 Google AI Studio 产品雏形 (Frontend/Visuals) 用法: 我通常先用 AI Studio 来开发前端界面。它的上下文窗口大,且视觉理解能力强,能迅速把我要的 UI/UX 甚至简单的交互逻辑给“画”出来。 🔵 Cursor (Auto Mode) 基础逻辑 (Logic/Functionality) 用法: 拿着前端的架子,转战 Cursor。利用 Cursor 的 Auto 模型开发后端的基本逻辑和功能模块。这是“盖楼”的阶段,让代码先跑起来。 🟣 Claude Code 深度优化 (Optimization/Fixing) 用法: 遇到顽固 Bug 或者逻辑不够优雅时,我会把代码喂给 Claude Code。它的逻辑推理能力目前是顶尖的,非常适合做“外科手术”式的修复和性能优化。 🟠 OpenAI Codex 最终审核 (Auditing) 用法: 最后,我会用 Codex 类的能力进行代码审查(Code Review),查漏补缺,确保安全性。 总结: AI Studio 画皮,Cursor 铸骨,Claude 注入灵魂,Codex 最后的体检。一定要交叉使用,跨平台学习,这是解决复杂问题的关键。 三、 遇到死局怎么办?让 AI 去“抄作业” 在做 Polymarket 这种特定项目时,你经常会遇到像 redeem(赎回)或 clob(中央限价订单簿)对接这种深水区。 很多时候 AI 搞不定,是因为它没见过最新的文档或特殊的 SDK 写法。这时候你哪怕把 Prompt 写出花来也没用。 我的“必杀技”: 如果 AI 持续报错,我给它的指令不再是“修复这个 Bug”,而是: “去 GitHub 上搜索关于 Polymarket redeem function 的最新 Python 实现方案,阅读并分析别人的代码,学习它是如何处理签名的,然后回来修改我的代码。” 让 AI 学会自我迭代: Search(搜索): 找现成的轮子。 Learn(学习): 理解别人的逻辑。 Iterate(迭代): 应用到你的项目中。 你不让它学习,它就是迟迟搞不定;一旦它学会了参考,效率是指数级提升的。 四、 结语:Vibe Coding 的终局 我看待 AI 编程的视角很简单:我不生产代码,我只是需求的搬运工。 现在的困难只是暂时的。我相信在不久的将来,我们现在的这一套“组合拳”流程也会被自动化取代。 未来的终局是: 你只需要提出一个需求(“帮我盯着 Polymarket 上的美国大选赔率做套利”),AI 会自动去寻找文档、自动写代码、自动测试、自动部署。 但在那一天到来之前,掌握这套“跨模型协作 + 引导式学习”的方法,就是你在 AI 时代最大的竞争壁垒。 PS : 还要学会PUA,不停的让AI换角色PUA,比如PM、CTO 、CEO 、顶级量化交易员等等。 最后如果还不解决问题,告诉你一个终极大招,骂,使劲骂!

比特币橙子Trader

13,225 просмотров • 7 месяцев назад

AI 视频生成,到各种 AI Agent,我一直在思考一个问题:AI 最终会如何改变人类创造和体验数字世界的方式? 最开始,AI 帮助我们生成文字和图片;后来,它开始生成越来越逼真的视频。但无论画面质量提升到什么程度,这些内容依然存在一个限制——我们仍然只是观看者。我们可以欣赏 AI 创造出来的场景,却无法真正进入其中,也无法与这个世界产生互动。 最近体验 Alaya World Alaya Lab 后,我第一次感觉,AI 视频生成正在探索一个新的方向:它不只是生成一段视频,而是在尝试生成一个可以被探索的世界。 Alaya World 是 Alaya Lab 推出的交互式视频世界模型。用户可以通过文字、图片或者视频作为初始条件,让模型生成一个动态世界。不同于传统视频生成模型“输入 Prompt,输出一段固定视频”的方式,Alaya World 更像是在探索过程中持续构建环境,用户可以在生成的世界中移动视角,并通过交互指令触发新的事件。 这也是我认为世界模型和普通视频生成模型最大的区别。 过去的视频生成模型解决的是“如何生成一段更加真实的视频”,而世界模型尝试解决的问题是“如何让一个世界持续存在”。如果你进入一个虚拟城市,向前探索,然后回头,你期待看到的是同一个城市,而不是一个重新随机生成的场景。 这背后涉及世界模型最核心的挑战:长时间生成的一致性。模型不仅需要知道下一帧画面应该是什么,还需要理解空间关系、历史状态以及用户行为对世界造成的影响。 Alaya World 在技术层面通过空间记忆机制、历史信息保留以及抗漂移训练等方式,提高长时间生成过程中的稳定性。目前模型支持 720p / 24 FPS 实时流式生成,并展示了超过一分钟的连续探索能力。 让我觉得这个方向有意思的地方,是它可能会重新定义未来数字内容的生产方式。 以游戏行业为例,过去一个虚拟世界需要大量人工制作:美术设计地图、程序编写规则、策划设计剧情。开发者需要提前创造一个固定世界,而玩家进入后按照既定规则体验。 但如果世界模型进一步发展,未来的游戏可能不再只是“开发者搭建世界,玩家进入世界”,而是“开发者定义规则,AI 实时生成世界”。玩家体验的不再是一个完全预设好的内容,而是一个随着交互不断变化的环境。 当然,Alaya World 目前仍然处于早期阶段。实时生成所需的算力成本、复杂环境理解能力,以及更长期、更稳定的世界一致性,都还有很多问题需要解决。但它让我看到一个值得关注的趋势:AI 的竞争可能不会只停留在生成更漂亮的图片和视频,而是进一步走向创造更真实、更连续、更可交互的世界。 过去,人类通过电影记录想象,通过游戏创造虚拟空间。而未来,也许我们只需要描述一个想法,AI 就可以帮助我们生成一个能够进入其中、探索其中的世界。 从生成内容,到生成世界,这可能是 AI 下一阶段最值得期待的变化之一。

Ashlyn He

12,005 просмотров • 24 дней назад