Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

为什么你的 Codex 5.6 搓出来的 3D 像一堆方块,别人的是产品级? 之前给大家分享的一个宝藏开源项目img2threejs,接入 Codex 5.6 后,就能完成: 2D 图像 → 结构分析 → Three.js 程序化模型 → 浏览器实时交互 它真正拉开差距的地方在于,给 AI 加了一套完整的程序化建模操作系统: 1️⃣AI 深度拆解轮廓、比例、细节特征 2️⃣从 Blockout 到灯光、交互,步步精进 3️⃣浏览器渲染对比,不完美就修改 4️⃣保留运行时层级、轴点和插槽 所以真正拉开你和产品级差距的,是你有没有把建模标准、检查点和返工机制,像 img2threejs 一样,写进你的提示词。 这才是 Codex 5.6 真正开挂的玩法! 我把我的promote放在评论区,可以参考~ 项目地址:

85,901 Aufrufe • vor 1 Monat •via X (Twitter)

0 Kommentare

Keine Kommentare verfügbar

Kommentare vom Original-Post werden hier angezeigt

Ähnliche Videos

Codex 隐藏玩法:把你每天重复教 AI 的提示词,直接做成 Skill 90% 的人用 Codex,其实都在重复做同一件事: 开一个新任务,把同一套要求再告诉它一遍。这些 Prompt 你可能已经复制粘贴了几十次。 但其实,这种反复使用的工作方法,完全可以直接做成 Codex Skill。 详细教程如下: 1️⃣先找一段你经常重复使用的 Prompt,比如我最近一直在用这类提示词: “执行任务前先检查需求漏洞和潜在风险,不要默认接受我的方案。涉及代码和结论必须验证,完成后按验收标准逐项检查。” 这类 Prompt 很好用,但最大的问题是:每开一个新任务,都要重新贴一次。 2️⃣直接让 Codex 把它做成 Skill把原来的 Prompt 发给 Codex,然后告诉它: 请把上面这套工作方式整理成一个可重复调用的 Codex Skill。 要求: · 明确这个 Skill 适合在什么情况下使用 · 把原来的要求整理成清晰的执行步骤 · 区分任务开始前、执行过程中和完成后的检查 · 保留必要的验证流程 · 删除重复和模糊的要求 · 不要改变原来的核心工作原则 Codex 就会把原来散乱的一段 Prompt,整理成一套完整的 Skill 工作流。 以后这些规则就不用一直躺在聊天记录里了。 3️⃣ 后面直接调用这个 Skill 再开新任务时,不需要重新复制那一大段 Prompt。 直接告诉 Codex:使用这个 Skill 完成当前任务。 最后你的 Codex 里保存的,就不再是一堆 Prompt,而是你自己的一整套工作流。 Prompt 是教 AI 这一次怎么做。 Skill 是把你的工作方法直接固化下来,以后每个项目都能重复调用。

爱丽丝呀!

40,505 Aufrufe • vor 1 Monat

以后机器人产品的官网就照着这个思路做,否则我不看~ Microduck 被解剖了,源码在 Hugging Face 上,并持续更新中~该网站吧 Microduck 的舵机、摄像头、ToF LiDAR、计算模块、电池、骨架全部拆开给你看,还能旋转、走路,甚至直接拖它的腿和脑袋。 本来以为只是一个做得比较炫的 3D 网页,翻了一下项目代码,发现里面塞的是真东西~ ① 官方 3D 模型直接塞进去了 项目使用了 Microduck 的 GLB 3D 模型,来源指向 Pollen Robotics 的 microduck_rl。 所以你看到的并不是作者照着机器鸭外形重新画了一个动画,而是把机器人的 3D 模型直接搬进浏览器,通过 Three.js 实时渲染。 ② 连真实步态数据也塞进去了 更有意思的是走路。 源码里直接放了一组 MICRODUCK_WALK_FRAMES,记录 Microduck 行走过程中各个关节的角度。 程序读取这些数据,再经过插值处理,实时控制 3D 模型对应关节旋转。 也就是,真实机器人步态数据 → 关节角度 → Three.js → 网页里的 Microduck 走起来 所以它不是提前做好一段“走路动画”然后播放。 ③ 15 个舵机也被拆出来了 Microduck 本身拥有 15 个自由度,使用 Robotis Dynamixel XL330 系列智能舵机。 网站把这些关节结构直接做进了交互模型,可以单独查看舵机和不同关节的位置。 ④ 传感器、芯片、电池也全部拆开 继续往下滑,可以看到视觉和测距系统、计算模块、电源和骨架。 包括摄像头、8×8 ToF LiDAR、双 IMU、Rockchip RK3566 计算平台以及 NP-F550 电池。 整个网站实际上是在做一张可以动、可以拆、可以旋转的 Microduck 3D 数字解剖图。 ⑤ 甚至把机器人 IK 也做进网页了 最新版本还加入了逆运动学 IK,现在可以直接拖 Microduck 的脚或者脑袋。 你拖脚,程序会反过来计算髋关节、膝关节等应该旋转多少,而且还给不同关节设置了运动范围限制。 所以研究完代码后发现,这东西已经不是一个炫酷官网了。React + Three.js + Microduck 官方模型 + 真实步态数据 + 机器人 IK,这是把一个轻量级的机器人数字孪生 / Simulator 塞进了浏览器。 最有意思的还是这种产品展示方式。 以前机器人官网:放几张产品图,再放几个 Demo 视频。 现在机器人网站:直接把机器人塞进网页里,想怎么看就怎么看,甚至可以自己拆着玩。 以后机器人产品的官网,就照着这个思路做~

玉米_AlphaNotes

12,186 Aufrufe • vor 16 Tagen

小扎吐槽苹果和 Google,以及谈为什么开源 AI **Mark Zuckerberg**: 我认为移动生态系统中普遍存在的一个问题是有两个把持入口的公司,Apple 和 Google,它们可以告诉你可以构建什么。 在我们的历史中有很多次,比如有经济层面的情况,就是我们构建了些东西,然后它们就会拿走我们大部分的收入,但还有一种是质量层面,这实际上让我更加不满,也就是有很多次我们推出或希望推出某些功能,然后Apple就会说,不,你不能推出这功能。 这真的很糟糕。 问题是,这样的世界是否会在AI领域复现,就像你会有一小部分拥有封闭模型的公司,它们控制API,因此将能够告诉你可以构建什么。 我可以说,对我们来说,自己构建一个模型以避免处于那种位置是值得的。 我不希望那些其他公司告诉我们可以构建什么,而且我认为从开源的角度来看,很多开发人员也不希望那些公司告诉他们可以构建什么。这就是我坚定支持开源的原因之一,我认为未来AI的集中化可能像其广泛传播一样具有潜在危险。 我发现很多人都在思考,如果我们能实现这种技术,那么让它广泛传播是否不利。 我认为另一种可能也很糟糕的情况是,如果一个机构掌握了一种强大的AI远超其他所有人的,这同样是非常糟糕的。在我看来,一个理想的世界应该是这样的:AI技术被广泛而均衡地应用,随着时间推移逐步增强其健康性。在这样的世界里,各种系统能够相互制衡,这种平衡的状态比一个高度集中化的世界要健康得多。 虽然风险无处不在,但我觉得有一个风险我想人们我并没有听到太多人提及。 **Dwarkesh Patel**:举例来说,一个价值100亿美元的模型,如果经过评估是完全安全的,你们会选择开源吗? **Mark Zuckerberg**:我的答案是,只要这个模型对我们有所帮助,那我们就会开源。 **Dwarkesh Patel**: 那如果这个模型是用100亿美元的研发经费研发出来的,然后现在要开源呢? **Mark Zuckerberg**: 我们一直以来都有开源软件的传统,但是我们并不会开源我们的产品。 比如说,我们并不会将Instagram的代码开源,但我们会开源许多底层的基础设施。我们历史上最大的一个项目可能就是开放计算项目。在这个项目中,我们将我们所有的服务器的设计网络交换机和数据中心的设计开源了,这对我们来说非常有帮助。 因为很多人可以设计服务器,但现在,大家普遍都采用了我们的设计,这就意味着整个供应链都围绕我们的设计展开,规 模变大,对所有人来说都变得更便宜,为我们节省了数十亿美元。 这真是太棒了,对吧? 因此,我认为开源有多种方式可以对我们有所帮助。 一种就是,如果有人能够找出更便宜的运行模型的方法,我们将花费数十亿甚至上千亿美元,在所有这些模型上,所以如果我们能做的更有效率,那我们就可以节省数十亿甚至上百亿美元,这可能本身就非常有价值。 **Dwarkesh Patel**: 关于开源,我很想知道你是否认为像PyTorch、React、Open Compute这样的开源项目,对世界的影响是否已经超过了Meta在社交媒体方面的作用。 **Mark Zuckerberg**: 因为我曾经和使用这些服务的人交谈过,他们觉得这是有可能的,因为互联网的很大一部分都在运行这些项目。这是一个有趣的问题,我认为几乎有一半的世界人口都在使用我们的产品,这是一个真实的点,所以我觉得这很难超越。 但不管怎样,我还是认为开源是一种新的、非常強大的建设方式。 来源:

宝玉

74,721 Aufrufe • vor 2 Jahren

Codex 操控电脑的三种方式。Codex 团队成员 Jason 今天写了一篇详细指南,把三者的区别和适用场景理清楚了,这里做个精简版。 【1】Computer Use:最广,也最慢 Computer Use 让 Codex 像人一样看屏幕、点鼠标、敲键盘,操作你电脑上的任何图形界面应用。Spotify、Xcode、系统设置、iOS 模拟器,甚至 iPhone Mirroring 都能控制。 代价是慢。结构化插件可以直接调 API,Computer Use 得一步步看界面、找按钮、等响应、再检查结果。但它能搞定没有 API 的应用,这是其他方式做不到的。 Mac 和 Windows 的体验差距很大:Mac 上 Codex 可以在后台静悄悄地操作,你继续用自己的电脑不受影响;Windows 上它必须占据前台,操作期间你没法用那台机器。 Jason 举了个例子:有次他的快递被偷了,Amazon 说要等 25 分钟才能接通客服。他让 Codex 每五分钟检查一次聊天窗口,客服出现后改为每分钟一次,自动完成退款流程。他去洗了个澡,回来退款已经办好了。 【2】Chrome 扩展:带着你的登录状态 Chrome 扩展让 Codex 使用你已登录的浏览器会话,包括 cookies、账号状态和已有标签页。Gmail、LinkedIn、Salesforce、公司内部后台,这些需要登录才能用的工具,Chrome 扩展是对的选择。 它还能同时控制多个标签页,在一个标签里读信息,到另一个标签里对比,再到第三个标签完成操作。Computer Use 也能操作浏览器,但它只认屏幕坐标,Chrome 扩展理解的是浏览器层面的上下文。 Jason 用它跑了一个长期任务:每天让 Codex 通过 Chrome 检查他的 Twitter 私信、浏览相关新闻、收集反馈,把有价值的内容存到本地文件,但不发任何消息。 要注意的是,网站会把 Codex 的点击和表单提交当作你本人的操作。研究、浏览、起草可以自动化,但发送、发布、付款这类操作最好留给自己确认。 【3】内置浏览器:给开发者的沙盒 内置浏览器住在 Codex 的对话线程里,你和 Codex 共享同一个渲染页面。它不带任何登录状态和 cookies,是个完全隔离的环境。 这反而成了开发场景的优势。它的主场是本地开发服务器、文件预览、公共网页、响应式布局检查和视觉 bug 复现。Codex 可以改代码、操作页面、截图、再跑一遍,形成紧密的反馈循环。 Jason 最喜欢的功能是标注:你可以直接在页面上点击某个元素留评论,比如"这个层级反了""这个按钮间距不够",Codex 会拿着截图和元素上下文去改代码,改完重新打开同一个页面等你下一轮标注。比来回传截图和文字描述高效得多。 【选哪个?】 简单记:任务需要登录状态用 Chrome,需要操作桌面应用用 Computer Use,在做前端开发用内置浏览器。如果有现成的插件或 MCP 能完成任务,优先用结构化工具,视觉控制是最后手段。

宝玉

185,988 Aufrufe • vor 3 Monaten

实战教程!给大家带来一期《从0到1开发并部署上线第一款生产级Agent》小白友好视频。​ ​ 我之前分享过很多关于Codex和Claude Code的教程,用它们做出了很多酷炫的东西,也实际提高了生产力。 但是知其然,而不知其所以然,所以最近潜心学习了很多Agent相关的概念:链路追踪、记忆系统、模型网关、沙箱工具......​ ​ 也在开发“书镜”Agent的过程中沉淀了一套自己的开发思路: 先用问答的方式和Codex对齐产品,写PRD文档; 再把PRD拆分成多个Plan.md; 用乔木老师开源的Skill撰写 /goal 提示词; 把Codex调整成“目标”模式,发送提示词; 开发一轮后,把所有plan.md整合成一个consolidation.md,然后重复上述过程进行下一轮开发。​ ​ 用Codex本地Agent开发好后,才算完成了第一步,下一步是部署上线,要保证能在生产环境中能够正常使用。​ ​ 我选择了腾讯云 EdgeOne Makers 边缘Web与AI Agent托管平台进行部署,因为确实比较方便简单,适合上手:​ 1.有内置的内容创作助手模板。记忆系统、沙箱工具、调用链路追踪、模型网关都是开箱即用,我直接把代码拿过来用Codex略改一下就能快速上线。​ 2.前后端(Web与Agent)共用同一个项目。传统的前端和后端是分隔开的,经常有跨域请求的麻烦,统一之后技术框架更为优雅,也能更好地统一管理账号、部署、监控和域名。​ 3.不限制部署项目的框架、语言和模型。Claude / OpenAI / LangGraph / CrewAI的框架都适配,没有自己的SDK;不限制开发语言(JS / Python);有统一的AI Gateway,但是也可以接第三方API。

逸尘

453,635 Aufrufe • vor 2 Monaten