Loading video...

Video Failed to Load

Go Home

从GPT-6 Astra发布以来,就一堆人在让Codex去通过computer use去操控blender做各种3D模型的。 但稍微做了点就停了。 然后我自己也拿Claude Code和Codex做了不少测试,发现不管是直接写代码的方式,还是操控blender的方式,从成本和效率来说都不是最好的方式。 所以我自己摸索了一套新的策略。用Codex 加 3D 基座模型 Tripo,做了一座能开车逛的巴黎。 整了两天,一行代码没写。一座能开进去的巴黎👇出来了! 现在视频演示里的车、树、铁塔、街上走路的人——全是 AI 生成的 3D 资产;而街区、桥、塞纳河——是代码画的。 为什么这么分? 因为你开车会开到车跟前,但不会开到桥底下去数栏杆。 近景给精细模型,远景交给代码。做出来的网页游戏会在细节和帧率上更平衡。 以及,除了这期视频,我还把一整套操作流程做成了386 页手册教程! 现已开源了,提示词、脚本、模型全在里面:

140,939 views • 2 days ago •via X (Twitter)

14 Comments

猫神王's profile picture
猫神王2 days ago

Computer use 操控 Blender 看着酷,账单和成功率先劝退一波。 小团队实测同款:屏幕代理适合 demo,不适合量产管线。 3D 交付要的是可编译门控,不是鼠标被 Agent 点来点去。

sysout's profile picture
sysout2 days ago

噢 看起来更复杂了 网上用的是blender mcp 不是computer used吧

AI IT PM in HK's profile picture
AI IT PM in HK1 day ago

這個拆法很像遊戲 LOD😂hh ..按「玩家能否接近並驗證」分配生成成本👍 可驗證區域給模型,背景交給規則

安叫兽|Bird🕊️ 🔶 BNB's profile picture
安叫兽|Bird🕊️ 🔶 BNB2 days ago

看起来难点不在能不能做,而在怎么少走弯路。

AI Mastery Guide's profile picture
AI Mastery Guide2 days ago

Claude doing 3D modeling is unexpected

Ty ⟪ λ ⇆ τ/Δφ→0 ⟫'s profile picture
Ty ⟪ λ ⇆ τ/Δφ→0 ⟫2 days ago

Computer use keeps looking magical until the task lasts longer than the demo 😭

✪ Sandro Fidélis's profile picture
✪ Sandro Fidélis2 days ago

Can I make Characters in Tripo with Claude ? How??

刘朝 Zhao Liu's profile picture
刘朝 Zhao Liu2 days ago

近景用高细节资产、远景用代码生成,这个拆分抓住了成本和帧率的共同约束。再加一层可编译门控:资产哈希、碰撞体、LOD、渲染预算和回归截图都要能验收。Computer Use适合探索,稳定交付要靠可重放的管线。

星火API's profile picture
星火API2 days ago

Computer use 点 Blender 看着酷,账单和成功率先劝退。你这招对:近景给资产模型,远景让代码画。能复跑才叫管线,不是录屏点鼠标。

Tracy LOISEL's profile picture
Tracy LOISEL1 day ago

Codex + MCP Blender + Rodin 3d

Sreekanth Reddy S's profile picture
Sreekanth Reddy S2 days ago

Where is the manual?

周彦充's profile picture
周彦充2 days ago

近景给模型、远景给代码,这个分法值钱在把贵的只花在读者会凑近看的地方。我 9 月 6 日三条出图通道全不通,短视频画面用的是脚本画的墨线,不靠出图模型,片子照样每天出。

Lennox's profile picture
Lennox2 days ago

我也发现,工具调用真正难的是状态管理,不是把命令跑起来。

Hau's profile picture
Hau2 days ago

thx, bro

Related Videos

AI时代,永远别低估一个人可能拥有的创造力。很多事情,几个月前你做不成,现在再试试可能就完全不同了。 半年前,我在完全没用过unity,没做过游戏开发的情况下尝试过用Cursor+Unity开发军事题材的3D射击游戏。 当时最大的瓶颈就是3D资产。市面上找的各种 AI 3D工具生成的装甲车模型,本质上是一坨无法拆分的疙瘩汤,想给炮塔、履带做独立动画和损伤效果根本不可能,项目直接卡死。我以为这事儿黄了,直到最近看到了 Hyper3D by Deemos 的 他们新推出的Rodin Gen-2有个叫BANG的架构,简直太绝了,它能理解模型是由不同部件组成的,能把任何3D模型都按合理的逻辑拆解,比如我这个视频里的装甲车、直升机、士兵等。 这种情况下,我能拿到独立的炮塔、车轮等,可以直接拿去做动画绑定和参数设定,这把我上次遇到的问题基本都解决了。 我突然意识到,才过了半年,我整个AI开发流程的工具几乎全换代了: 1、AI编程工具从Cursor换到Claude Code。 2、2D素材从Midjourney换到Nano Banana。 3、而3D资产这块的进化是最颠覆的,直接从玩具变成了工具。 所以,别给自己设限,别给AI设限,你只需要想清楚自己想做什么,每隔半年试试看,很可能会有意想不到的惊喜。 我觉得hyper3d这个新能力有机会让很多游戏小团队提效,也会让很多像我这样0基础的开发者也有机会整出自己首个3D游戏出来。

花叔

79,931 views • 11 months ago

这两天看到我一直很喜欢的设计师阿哲 阿哲Phil 的个人网站,我挺喜欢他个人主页的那个风格。 看着看着突然冒出一个念头: 这种个人审美很强的网站,模型光看录屏,能不能做出来? 于是我顺手录了 10 秒左右,从页面上划过去,直接把视频丢给 Ling-3.0-flash-VL,让它照着做一版。 没给源码,也没拆页面,更没写一大段提示词。输入就那段录屏,加上一句很简单的需求。其实扔进去的时候,我没抱多大期待。视频一晃就过去了,有些细节让我自己暂停看,也未必记得住。 Ling-3.0-flash-VL 是百灵在 Ling-3.0-flash 上加了视觉理解和 visual agent 的版本。官方提到的能力挺多,视觉感知、STEM、文档、前端编码、医疗报告都在里面。我这次没全测,就看一件事:它能不能看完一段网站录屏,真把页面做出来。 结果打开以后,我确实愣了一下。 按肉眼看,和阿哲的原版大概有七成像。大的版式、配色和页面感觉都抓到了,生成出来的也不只是一个摆着看的空壳。按钮能点,交互能跑,放进浏览器里,已经像个可以接着改的半成品。 当然,剩下那三成也挺明显。风格不够细腻,字体没那么贴,交互还是有点僵,一些细节只学到了大概。把两个页面并排放在一起,差距还是能看出来。要我直接拿去上线,我肯定不会;拿它当第一版,我觉得够了。 以前脑子里有个页面的样子,最麻烦的是说不清。你跟开发说想要“有点设计感”“交互顺一点”,讲了半天,对方可能还是不知道你想要什么。自己不会写代码的话,很多想法就一直停在收藏夹里。 现在简单多了。先找一个接近自己想法的网站,录一小段,让模型搭出来。哪里不对,直接看着页面改。它没有把阿哲的网站原样搬过来,但它把一张白纸直接做到了七成。 所以这次测完,我还挺愿意安利 Ling-3.0-flash-VL。离专业前端当然还有距离,但对没代码基础、想做个人网站或者产品 Demo 的人来说,先把第一版弄出来,已经能省不少事了。 感兴趣的都可以去试一试:

阿川 | AI thinking

29,239 views • 4 days ago

Qwen3-Next-80B-A3B 实测! 能跟头部模型对打吗? 直接说结论, 能完成我这个大象牙膏测试的一部分, 已经很厉害了, Python 杯子倒水那个测试表现也可圈可点. 来看测试中暴露出来的问题: 首先这个模型生成的样式特别多变, 可以看测试中生成的前端页面的样式和布局, 几乎每次都不一样. 所以实际使用中, 可能会存在稳定性的问题, 建议 prompt 中多做约束, 避免模型过度发挥. 不过这并不全是坏处, 如果拿这个大模型写文, 反而可能会超常发挥, 每次写出来的东西都不一样, 不会呆板. 另外目前发现最大的问题是, 给到模型一大堆数据, 让模型整理一个网页, 结果模型偷懒了, 直接把代码和数据省略掉了, 这个应该还是 GPT-4 时代的问题 (24年上半年) 出现了. 这里猜测可能是高稀疏性专家混合模型或者多词元预测造成的问题, 这两个都会在生成中选择最经济的生成模式, 因此可能会倾向于生成"此处代码省略"这样的代码来替代原本要生成一大堆代码的场景. 召回倒是没太大问题, 鞭炮连锁爆炸那个测试, 虽然模型没有成功写出来, 但是最长的一次还是生成了1100行代码, 我仔细看了下, 基本都考虑到了我 prompt 中要求的逻辑, 只不过实现的代码有 bug 跑不起来而已. 综合来讲, 我觉得这应该是 100B 以内的模型无敌手了, 考虑到定位可能是个新的技术试验模型, 所以期待千问推出更大规模 (例如400B-A15B) 的模型, 带来更好的性能. 测试 prompt: #Qwen3Next #大模型竞技场 #Qwen3

karminski-牙医

30,709 views • 1 year ago

OpenAI刚刚开源的这个东西,感觉要把程序员的工作方式给整个改写了。 现在大家都在卷模型写代码有多强,但其实真正的瓶颈早就不是生成了。 一个人每天最多同时有效监督3-5个编码Agent,再多就会注意力崩溃,生产力直接归零。 有了Symphony,直接把这个上限干到了几十个。 它把你的Linear、GitHub Issues直接变成了永远在线的Agent调度器。 你开一个任务,它自动启动一个独立隔离的Codex Agent。 自己写代码,自己跑测试,自己做交叉Review,damn! 全部搞定之后,会给你提交一个完整的证据包。 CI全绿,安全和性能专项审查通过,改了UI就自动录好操作视频。 所有验证全过了,才会出现在你的Human Review队列里。 以后人类的角色可能会被彻底颠覆了。 以前你是监工,盯着Agent一步一步写代码,上下文切到吐。 现在你是老板,只需要看最终的结果。 满意就点合并,不满意就去仓库里补规则补文档补Guardrails。 记住兄弟们,永远不要手把手指挥Agent,永远不要替它干活。 这可不是啥实验室概念,OpenAI自己已经这么干了。 三个工程师,五个月,写了一百万行代码,0行人工写的。 产品已经有几百个内部用户,每天都在迭代。 我觉得他们最厉害的不是模型,是他们把整个仓库变成了Agent能看懂能自主工作的乐园。 现在很多人都搞错了Agent时代的核心竞争力。未来不是谁的模型更聪明,而是看谁能设计出让Agent可靠自主工作的环境。 我觉得未来最好的工程师,再也不是写代码最快的人,而是那些最会写规则,最会设计反馈回路,最会给Agent搭舞台的人。 现在Symphony已经开源了,它甚至不是一个成品。 是一个17k token的完整SPEC。 你把这个SPEC喂给任何一个编码Agent,十分钟就能生成你自己定制版的Symphony。 GitHub地址评论区自取👇

AYi

63,210 views • 4 months ago

我在AI 训练和推理这行干了很多年,最近越来越觉得,机会正在往两个方向转移 为了让所有人都能理解这个趋势,我拆解了一家Harvey的 AI 律师公司,他们用开源模型在特定领域 GLM 击败了 Fable5 和 GPT-5.6,我认为是个趋势 本来写了一篇长文来科普,后来觉得字数太多,于是 做了一个教学 Skill 工具,把写好的稿子变成一个音频同步的视频 如果你想转行,我很推荐两个方向 > 一个是后训练,也就是拿一个已经很聪明的模型,在明确的任务、工具和成本约束下,再针对这条生产线加练一遍 > 另一个是AI 推理,其实两者不分家 , 最后自己读一遍都觉得,这么多公式和缩写,谁会看完呢?我自己文字读多了都觉得累。所以干脆换个办法,把它做成了一个不到十分钟的小视频,一边讲,一边在白板上把图画出来。视频放在下面 视频里我按一堂课的顺序讲了下面这些 1. 为什么通用模型在一条具体生产线上不是最优,后训练到底在修什么 2. 开放权重和闭源的区别 3. 监督微调和 GRPO 各管什么,GSPO/GRPO/LoRA 的应用差异 4. 在垂直领域,开源模型 overall 是如何击败闭源模型的? 这个视频是我自己搭的一个小工具做出来的,逐字稿进去,配音和白板动画自动出来,讲到哪句画到哪步。工具还在打磨,做顺手了再拿出来细说。

美研芒格君

34,060 views • 3 days ago