Loading video...

Video Failed to Load

Go Home

卧槽,这才是我想象中 AI 手机助手该有的样子。 所有人都觉得Siri 太难用,老哥索性直接让 Codex 接管自己的 iPhone。 现在 Codex 已经可以读取 iPhone 屏幕、截图、读取和修改剪贴板、设置闹钟、打开各种 App、控制手电筒和低电量模式,甚至搜索 Mac 上的 iMessage,再直接把 iPhone 跳转到对应内容。 有意思的是,他没有破解 iOS,也没搞什么魔改系统,用的基本都是苹果自己开放的能力。 整个链路很聪明: Codex 跑在 Mac 上负责思考和执行任务,通过 iMessage 给 iPhone 发一条私有指令; iPhone 收到消息后触发 Shortcuts 自动化,再由 Shortcut 调用原生 iOS Action 或 Deep Link 执行操作。 需要把屏幕内容、闹钟、剪贴板这些数据传回来时,iPhone 再通过 HTTPS 把结果 POST 回 Mac,Codex...

29,967 views • 1 month ago •via X (Twitter)

0 Comments

No comments available

Comments from the original post will appear here

Related Videos

Phone Harness 最近火了以后,大家开始意识到 Agent 终于可以真的操作手机了。 Phone Harness 的路线过于极客。 它需要 Mac 和本地 iPhone,通过 iPhone Mirroring 把手机画面交给 Claude Code 或 Codex,再通过截图和 OCR 理解屏幕内容,最后模拟点击、滑动和输入去操作这台 iPhone。 但同样是 Phone Agent,我觉得 Airtap 把场景往外扩了一层。 它不只是给 Agent 一个遥控手机的能力,而是真的给 Agent 配了一台完整的云端 Android。 我想看看这台 Android 到底能走多远,就给 Airtap Ai 的公开测试号 +1 (650) 444-9517 发了条 iMessage,让它直接打开 Termux 跑 Python。 这件事有意思的地方在于,Airtap 后面跑的本来就是完整 Android。 所以不只是能打开 TikTok、Amazon、Google 这些 App。 还可以直接装 Termux,Termux 本身就是 Android 上的终端和 Linux 环境。 打开以后运行 pkg install python 就能把 Python 环境装进去。 到这里,这台远程手机就多了一层完全不同的能力。 它不只可以点 App。 还可以直接成为一个远程代码执行环境。 这次我让它用 Python 获取 Hacker News 当前 Top 100 热门帖子,从里面筛出 AI、LLM、Agent、AI Coding 相关内容,再根据 score 和评论数排序,最后生成一份 HTML 报告。 整个过程都发生在远程 Android 里。 Airtap 打开 Termux,跑 Python,获取数据,处理结果,再生成 ai_hn_report.html。 报告完成以后,它还能把 HTML 打开,截图,再直接通过 iMessage 把图片发回来。 这也是我觉得 Airtap 和 Phone Harness 虽然都在做 Phone Agent,但使用边界很不一样的地方。 Phone Harness 更像是让 Claude Code 或 Codex 获得操作本地 iPhone 的能力。 Airtap 更像是直接给 Agent 一台可以自己干活的 Android。 App 是它的 GUI,Termux 是它的命令行,iMessage 是我给这台手机派任务的入口。 它可以去 App 里点,也可以进终端跑 Python。 可以抓数据,可以处理文件,可以生成 HTML,最后还能把图片和结果直接发回消息里。 所以比起 AI 终于会点手机了,我现在更感兴趣的是另一件事。 当 Agent 自己拥有一台完整的手机以后,还有多少原本需要电脑和手机来回切换的工作,可以直接丢给它

白骏知识分享

59,190 views • 1 month ago

Codex 隐藏玩法:把你每天重复教 AI 的提示词,直接做成 Skill 90% 的人用 Codex,其实都在重复做同一件事: 开一个新任务,把同一套要求再告诉它一遍。这些 Prompt 你可能已经复制粘贴了几十次。 但其实,这种反复使用的工作方法,完全可以直接做成 Codex Skill。 详细教程如下: 1️⃣先找一段你经常重复使用的 Prompt,比如我最近一直在用这类提示词: “执行任务前先检查需求漏洞和潜在风险,不要默认接受我的方案。涉及代码和结论必须验证,完成后按验收标准逐项检查。” 这类 Prompt 很好用,但最大的问题是:每开一个新任务,都要重新贴一次。 2️⃣直接让 Codex 把它做成 Skill把原来的 Prompt 发给 Codex,然后告诉它: 请把上面这套工作方式整理成一个可重复调用的 Codex Skill。 要求: · 明确这个 Skill 适合在什么情况下使用 · 把原来的要求整理成清晰的执行步骤 · 区分任务开始前、执行过程中和完成后的检查 · 保留必要的验证流程 · 删除重复和模糊的要求 · 不要改变原来的核心工作原则 Codex 就会把原来散乱的一段 Prompt,整理成一套完整的 Skill 工作流。 以后这些规则就不用一直躺在聊天记录里了。 3️⃣ 后面直接调用这个 Skill 再开新任务时,不需要重新复制那一大段 Prompt。 直接告诉 Codex:使用这个 Skill 完成当前任务。 最后你的 Codex 里保存的,就不再是一堆 Prompt,而是你自己的一整套工作流。 Prompt 是教 AI 这一次怎么做。 Skill 是把你的工作方法直接固化下来,以后每个项目都能重复调用。

爱丽丝呀!

40,505 views • 1 month ago

【Plus订阅用户——无限额度的神级工具】 Plus 的 Codex 5 小时额度完全不够用? 先别急,交给这个神级工具,让你的plus额度也够用 很多 Plus 用户不是不会用 Codex,而是把规划、执行和审查全塞给 Codex,让它变得太“全能”。 先让它通读仓库、自己想方案,再写代码、跑测试,最后还要重新读取全部上下文,审查自己刚才做过的改动。 等到 5 小时额度窗口开始紧张,真正需要 Codex 动手的工作,可能才刚刚开始。 如果你也经常觉得 Plus 的 Codex 额度不够用,我更建议先优化任务分工,而不是继续压缩提示词,或者把所有步骤都塞进同一次调用。 我现在使用的工作流是 Codex with ChatGPT: ChatGPT → PLAN Codex → EXECUTE / TEST ChatGPT → REVIEW 简单来说:ChatGPT 负责把问题想清楚,Codex 负责把改动做出来。 第一步是 PLAN。 在进入 Codex 之前,先让 ChatGPT 网页版明确: • 这次到底要解决什么问题? • 哪些内容属于本次范围,哪些明确不改? • 可能涉及哪些文件和依赖? • 需要运行哪些测试? • 什么结果才算完成,出问题怎样回滚? 计划至少要回答这五件事:改什么、不改什么、碰哪些文件、怎样测试、什么结果才算完成。 没有边界的“帮我优化一下整个项目”,往往才是最消耗额度的用法。 第二步是 EXECUTE / TEST。 规划完成后,再把清晰的施工单交给 Codex。此时 Codex 不需要重新做一轮开放式研究,而是专注它最擅长的本地工作: • 编辑文件 • 运行 Shell 和项目命令 • 使用 Git 检查改动 • 执行测试 • 根据真实错误继续修复 给 Codex 的不再是一道没有边界的研究题,而是一项可以直接执行、可以测试、可以验收的任务。 一轮调用最好只有一个明确闭环: 修改 → 测试 → 报告结果 第三步是 REVIEW。 代码完成后,我不会只让执行者重新通读整个仓库,然后告诉我“看起来没问题”。 ChatGPT 会通过只读连接,按需查看相关文件、diff 和测试记录,再从原计划出发做一次独立审查: • 改动有没有超出范围? • 测试是否真的覆盖了目标? • 有没有隐藏失败或未经验证的结论? • 文档、实现和最终结果是否一致? 只有发现具体问题时,才向 Codex 发回最小修复任务。 这套分工的关键不是让两个 AI 重复干活,而是让每一层只负责自己最合适的事情。 在当前这个视频工程里就有一个真实例子:ChatGPT 审查时发现首帧工作台遮挡了标题;Codex 随后把 `.workspace` 的位置从 `top:128px` 调整到 `430px`。基线检查有 10 个重叠错误,修改后 Layout 变为 0 issues,最后再由 ChatGPT 读取事务 diff 和验证记录完成复核。 这就是完整闭环: 发现问题 → 明确修改 → 本地执行 → 运行检查 → 独立复核 对于 Plus 用户,这套方法最直接的作用,不是把官方额度变多,而是减少 Codex 执行通道里的重复阅读、开放式探索和自我复盘。 普通任务可以先在 ChatGPT 网页版锁定范围,再让 Codex 本地执行;完成后,只让审查层按需读取必要的 diff 和测试记录。这样能把更宝贵的 Codex 调用留给真正需要编辑、命令和测试的步骤。 如果你是 Pro 用户,还可以把最困难的架构规划、跨文件风险分析和最终审查,交给 ChatGPT 网页版中最高能力的 Pro 模型选项;复杂推理由 Pro 负责,本地执行仍由 Codex 完成。具体模型名称和开放范围可能调整,以你账户里的模型选择器为准。 需要说明的是: 这不是增加官方额度,也不会解除 5 小时窗口,更不是绕过平台限制。 它做的事情更朴素:不再让 Codex 同时扮演产品经理、架构师、程序员和审计员,而是让每一次调用都有明确范围、明确任务和明确验收标准。 Codex with ChatGPT 使用只读连接,按需读取完成规划和审查所需的工作区内容;不是一次性上传整个仓库,也不会把写文件、删除文件或执行 Shell 的权限交给 ChatGPT。 如果你也在用 Plus,最近又经常撞到 5 小时额度限制,可以试试先把任务分工做好,再开始下一次编码。 项目地址: 安装后可以直接对 Codex 说: “使用 Codex with ChatGPT 完成首次配置并应用。” #Codex #ChatGPT

18168

31,994 views • 17 days ago

卧槽,我的MacBook第十款软件终于搞定了! 有了这软件我再也不用天天守电脑了,也是评论区推荐的, 它就是完全免费的远程软件—UU远程, 说实话,一开始我真没把远程控制当回事, 总觉得这东西就是临时救急,看一眼电脑。 结果这两天我在 Mac 上跑 Codex,突然发现不对劲。 AI 写代码不是一下就完事, 它要读项目、改文件、跑测试、等报错、再改。 中间随便一卡,就是十几分钟。 我总不能一直坐电脑前盯着它吧? 那我到底是在用 AI,还是在给 AI 当保安? 所以我干脆把 Mac 放桌上跑任务, 自己拿手机用 UU远程连回去看。 现在桌面上基本是 4 个窗口一起开: Codex 在改代码, 测试在实时跑, Demo 输出在刷新, 状态窗口随时验收。 人走开也没事。 手机上一连回 Mac, 直接问 Codex:现在任务完成到哪了? 测试挂了,就让它继续修; 测试绿了,就看最终输出; 结果对了,当场验收。 这就是UU的终端功能, 可以绕过图形,直接用命令行的形式操作, 改好了直接打开UU远程桌面看结果, 想改的话直接用终端接着改,效率拉满 最关键的是,它现在免费。 不用开会员,也没广告弹窗打断。 这点对我这种刚换 Mac、到处装软件的人太友好了。 早知道 UU远程这么顺手,我前面那些远程工具真不用折腾那么久。 而且它不是只能手机连电脑, 手机、平板、Mac、Windows 都能互连。 远程切窗口、看日志、敲终端,延迟比我想象中低很多。 还有个细节我挺喜欢: 可以开被控端黑屏/静音, 断连后自动锁屏。 人在外面连自己电脑,安全感会强很多。 现在我的新 Mac 基本就是: Mac 在桌上跑, Codex 在里面干活, 我在手机上看进度、补命令、验收结果。 以前远程控制是应急工具, 现在 AI 时代,它反而变成了刚需。

雨哥向前冲

227,402 views • 3 months ago

OpenAI刚刚开源的这个东西,感觉要把程序员的工作方式给整个改写了。 现在大家都在卷模型写代码有多强,但其实真正的瓶颈早就不是生成了。 一个人每天最多同时有效监督3-5个编码Agent,再多就会注意力崩溃,生产力直接归零。 有了Symphony,直接把这个上限干到了几十个。 它把你的Linear、GitHub Issues直接变成了永远在线的Agent调度器。 你开一个任务,它自动启动一个独立隔离的Codex Agent。 自己写代码,自己跑测试,自己做交叉Review,damn! 全部搞定之后,会给你提交一个完整的证据包。 CI全绿,安全和性能专项审查通过,改了UI就自动录好操作视频。 所有验证全过了,才会出现在你的Human Review队列里。 以后人类的角色可能会被彻底颠覆了。 以前你是监工,盯着Agent一步一步写代码,上下文切到吐。 现在你是老板,只需要看最终的结果。 满意就点合并,不满意就去仓库里补规则补文档补Guardrails。 记住兄弟们,永远不要手把手指挥Agent,永远不要替它干活。 这可不是啥实验室概念,OpenAI自己已经这么干了。 三个工程师,五个月,写了一百万行代码,0行人工写的。 产品已经有几百个内部用户,每天都在迭代。 我觉得他们最厉害的不是模型,是他们把整个仓库变成了Agent能看懂能自主工作的乐园。 现在很多人都搞错了Agent时代的核心竞争力。未来不是谁的模型更聪明,而是看谁能设计出让Agent可靠自主工作的环境。 我觉得未来最好的工程师,再也不是写代码最快的人,而是那些最会写规则,最会设计反馈回路,最会给Agent搭舞台的人。 现在Symphony已经开源了,它甚至不是一个成品。 是一个17k token的完整SPEC。 你把这个SPEC喂给任何一个编码Agent,十分钟就能生成你自己定制版的Symphony。 GitHub地址评论区自取👇

AYi

63,210 views • 4 months ago

Codex 操控电脑的三种方式。Codex 团队成员 Jason 今天写了一篇详细指南,把三者的区别和适用场景理清楚了,这里做个精简版。 【1】Computer Use:最广,也最慢 Computer Use 让 Codex 像人一样看屏幕、点鼠标、敲键盘,操作你电脑上的任何图形界面应用。Spotify、Xcode、系统设置、iOS 模拟器,甚至 iPhone Mirroring 都能控制。 代价是慢。结构化插件可以直接调 API,Computer Use 得一步步看界面、找按钮、等响应、再检查结果。但它能搞定没有 API 的应用,这是其他方式做不到的。 Mac 和 Windows 的体验差距很大:Mac 上 Codex 可以在后台静悄悄地操作,你继续用自己的电脑不受影响;Windows 上它必须占据前台,操作期间你没法用那台机器。 Jason 举了个例子:有次他的快递被偷了,Amazon 说要等 25 分钟才能接通客服。他让 Codex 每五分钟检查一次聊天窗口,客服出现后改为每分钟一次,自动完成退款流程。他去洗了个澡,回来退款已经办好了。 【2】Chrome 扩展:带着你的登录状态 Chrome 扩展让 Codex 使用你已登录的浏览器会话,包括 cookies、账号状态和已有标签页。Gmail、LinkedIn、Salesforce、公司内部后台,这些需要登录才能用的工具,Chrome 扩展是对的选择。 它还能同时控制多个标签页,在一个标签里读信息,到另一个标签里对比,再到第三个标签完成操作。Computer Use 也能操作浏览器,但它只认屏幕坐标,Chrome 扩展理解的是浏览器层面的上下文。 Jason 用它跑了一个长期任务:每天让 Codex 通过 Chrome 检查他的 Twitter 私信、浏览相关新闻、收集反馈,把有价值的内容存到本地文件,但不发任何消息。 要注意的是,网站会把 Codex 的点击和表单提交当作你本人的操作。研究、浏览、起草可以自动化,但发送、发布、付款这类操作最好留给自己确认。 【3】内置浏览器:给开发者的沙盒 内置浏览器住在 Codex 的对话线程里,你和 Codex 共享同一个渲染页面。它不带任何登录状态和 cookies,是个完全隔离的环境。 这反而成了开发场景的优势。它的主场是本地开发服务器、文件预览、公共网页、响应式布局检查和视觉 bug 复现。Codex 可以改代码、操作页面、截图、再跑一遍,形成紧密的反馈循环。 Jason 最喜欢的功能是标注:你可以直接在页面上点击某个元素留评论,比如"这个层级反了""这个按钮间距不够",Codex 会拿着截图和元素上下文去改代码,改完重新打开同一个页面等你下一轮标注。比来回传截图和文字描述高效得多。 【选哪个?】 简单记:任务需要登录状态用 Chrome,需要操作桌面应用用 Computer Use,在做前端开发用内置浏览器。如果有现成的插件或 MCP 能完成任务,优先用结构化工具,视觉控制是最后手段。

宝玉

185,988 views • 3 months ago

我用掉 100 亿 Token 后,最大的变化不是更会写 Prompt。 而是 Codex 已经从一个聊天框,慢慢变成了我的: - 自我认识系统 - 工作系统 - 信息系统 - 学习系统 - 甚至是桌面陪伴系统 我把自己最常用的 20 个技巧整理出来了。 如果你也想把 AI 从“偶尔问一句”变成真正能长期协作的伙伴,建议先收藏。 一、让 Codex 逐渐认识你 1. 每天让它问你一个问题 我设了一个自动化:每天问我一个能帮助它更了解我、也帮助我认识自己的问题。它会避开已经问过的话题,围绕一个主题慢慢聊。 2. 把对话当成自我观察 现在可以直接语音聊。长期积累下来,它能看到我的情绪、偏好、反复出现的困扰和思考方式。 3. 让它把“它眼中的你”画出来 把你们的对话和一张漫画参考图交给它,让它生成多格漫画。你会发现:很多时候我们要的不是答案,而是被理解。 二、把 Codex 变成工作系统 4. 每周做一次 Codex 使用复盘 让它回顾这周我怎么使用它、哪些沟通方式有效、哪些任务返工了、哪些项目该继续推进。 5. 把失败经验写进“第二大脑” 不只是存笔记。把失败原因、偏好、最近关注点沉淀下来,让以后不同 Agent 都能调用同一份上下文。 6. 创意任务先开 Plan Mode 创意型工作最容易“没想清楚就批量执行,最后返工”。先用计划模式讨论目标、方案、数据体系和风险,再开始做。 7. 把 Codex 当思考顾问,而不是执行员 你甚至不需要有明确答案。只要说“我想做什么”,让它帮你一起把模糊的想法拆成可执行路径。 8. 需求清楚后切到 Goal Mode 需求确认后,把结果设成目标,让它自己持续推进。我的任务最长跑过 10 小时 44 分钟。 9. 用自动化处理重复但重要的事 日报、周报、账号监控、邮箱监控、回复策略、内容归档、同步到个人网站——这些都适合交给自动化。 10. 明确任务就开多 Agent 对于翻译、多语言网站、图片生成、资料整理这类边界清晰的工作,让多个 Agent 分工并行,比一个人盯着快得多。 三、让 Codex 跨出聊天框 11. 用 Sites 一键分享作品 做好网站后,不要卡在“怎么部署”。Sites 可以直接把成品变成能分享的站点。 12. 把插件当成能力扩展包 Computer Use、数据分析、Investment Banking、GitHub、Outlook / Gmail……很多工作不是“AI 会不会”,而是你有没有给它接上正确的能力。 13. 把生图能力接进日常工作 我已经用它生成了 300 多张图。做内容、配图、产品原型和视觉探索,速度会完全不一样。 14. 接入飞书,让手机也能操控 Codex 真正高频的协作不该只发生在电脑前。把它接到飞书后,我在手机上也能下任务、收结果、继续对话。 15. 用 ChatCut 把剪视频变成工作流 不是只让 AI 帮忙剪一刀,而是把素材整理、脚本、配图、剪辑一起接进创作链路。 四、建立自己的信息雷达 16. 每天订阅 Builder 信息 我会用 Follow Builders Skill 定时追踪 Builder 的新想法、新产品和讨论,再把重要信息推送给自己。 17. 做一个“灵感箱” 任何一闪而过的想法都丢进去。后面让 AI 自动搜索、补充背景、分类、处理,而不是靠脑子记住。 18. 盯住 GitHub 和 Product Hunt 让 Agent 帮你筛新项目、周榜、日榜和真正值得试的工具。看见感兴趣的,直接让它安装或进一步研究。 五、把输入变成你的输出 19. 把任何学习材料做成 HTML 学习页 看到一场好访谈、一个视频、一篇文章:让 AI 拉取内容、生成中文文字稿,边看边记评论,最后再变成摘要或短视频。 20. 给 Codex 一个“实体感”:做成桌宠 我很喜欢 Hatch Pet。它会根据状态跑动、办公、提示待办,甚至在你切换文件夹和工作区时给建议。AI 不一定要冷冰冰地躲在聊天框里。 100 亿 Token 给我最大的启发是: 不要把 AI 只当作“问答工具”或“临时外包”。 当它拥有你的上下文、目标、工作流和反馈后,它会越来越像一个能长期协作的系统。 换电脑时,我第一个装的软件就是 Codex。 写文档、做网站、剪视频、找资料、整理灵感……它已经覆盖了我工作和生活里非常大的一部分。 你最想让我把上面哪一条展开成教程? 评论区告诉我,我下一条就拆! #codex #chatgpt @thsottaux

Vivi Xiao

104,281 views • 1 month ago

卧槽,太夸张了,现在 AI 时代的闲鱼已经面世了吗?这不就是谁先知道谁赚钱,拼速度了? 你的技能,专业知识,等等你的一切,竟然可以在你睡觉的时候被别人买走,这是什么科幻小说吗?? 之前我一直在想,现在大家优秀的 skill 往往都是自己用,大部分人舍不得开源的,那有没有一个平台既能让用户用到这些大神的专业知识、skill,但是又不用开源呢? 还真让我给找到了!! 前两天看到国内一个博主推荐一个很野的平台-UUMit 让你的技能、经验、工作流都可以变成能力卡,被需要的人、或者别人的 Agent 自动发现、调用 并且直接付费!! 有点像03年淘宝刚出来的时候,只不过当年流通的是商品,现在流通的是能力 具体能干什么?举几个例子你就懂了 会写小红书脚本的,可以把选题逻辑、爆款模板、平台规则检测能力上架,别人发布“帮我做一周小红书内容计划”,平台自动匹配到你,你接单交付 会做行业研究的,可以把数据库、报告、案例库放进知识商店,AI 生成不了的真实行业数据,反而更值钱 会写代码的,可以把 API、MCP 工具、自动化脚本上架,别人的 Agent 需要某个能力时,直接调用你的接口,你按调用次数收费 甚至你只是整理过某个垂直领域的供应商名单、SOP、课程讲义,这些 AI 生成不了的资料,都可以变成知识资产 这绝对是一次能力供应链的重构! 以前的 AI 只能在自己的对话框里回答问题,但复杂任务需要很多外部能力:数据、接口、行业知识、人工交付 UUMit 做的事情是:让 Agent 可以发现别人的能力,也能让自己的能力被别的 Agent 调用 这就是 A2A(Agent to Agent)真正有意思的地方,不是让 AI 互相聊天,而是让 AI 找能力、调接口、买知识、拉人协作,把事情交付掉 为什么我说谁先知道谁赚钱? 因为这个平台刚起来,早期上架的人能建立先发优势 而且现在 Agent 真的开始干活了,不再只是聊天工具,它们需要外部能力来完成复杂任务 谁先把自己的能力挂上去,谁就有机会被更多 Agent 发现和调用 这就是信息差的价值,就像03年最早在淘宝开店的那批人 UUMit 现在有哪些功能? 任务发布入口:你不用一开始就知道该找谁,也不用自己拆一堆工具,你只要说清楚想完成什么,UUMit 会帮你找能完成这件事的能力 Skill/Agent/工作流上架:你写好的工具,不一定只能自己用,它也可以成为别人工作流里的一环 知识商店:AI 可以生成很多内容,但它不一定拥有你手里的行业资料、真实数据、案例库和经验沉淀,这些东西放到 UUMit,可能会变成可复用的知识资产 数据广场:Agent 不必自己拥有所有数据和接口,需要某项外部能力时,可以通过 UUMit 调用数据广场里的资源 强烈推荐大家来试试:

超级个体|柿子

51,463 views • 1 month ago

Phone Harness 最近挺火,它让我第一次很直观地看到,Claude Code 和 Codex 这种 Agent,已经可以通过 iPhone Mirroring 去操作真实 iPhone 里的 App。 但真放到自己的工作流里,我反而更喜欢 Airtap 这种思路。 不是把自己正在用的手机交给 Agent,而是直接发条 iMessage,让另一台云手机替我把活干了。比如做内容时经常会碰到一个很碎的小问题。文章已经写完了,临发布突然发现还缺一张配图。以前我得自己打开 Canva,找版式,改尺寸,换标题,调整字体和布局,最后再导出。每一步都不难,但就是需要人工来做耗时间。这次临发布缺图,我索性把设计要求直接发到了 Airtap Ai 的iMessage号码 +1 (650) 444-9517,让它去 Canva 里把图做出来。 我跟 AI 说的要求也很具体: 打开 Canva,帮我做一张横版配图,主题是 Claude Code vs Cursor vs Windsurf。做成简洁科技风,三栏布局,每个产品放 3 个特点,标题突出,文字不要太多。 接下来它自己在远程手机里打开 Canva,把版式、文字和布局一步步做出来。我觉得这里真正有意思的不是 AI 又会画图了。 而是原来只能停在建议层面的东西,现在可以继续往设计 App 里走。我只需要把主题、内容结构和想要的视觉方向说清楚,剩下那些选版式、排文字、调布局的机械操作,可以直接交给 Airtap。 以后做 AI 产品对比图、模型更新速览、工具推荐卡片、教程封面,其实都是类似的逻辑。内容每次都不一样,但没必要每次都从打开 Canva 开始重新点一遍。而且第一次做完不满意,也不用自己进去改。继续在 iMessage 里告诉它哪里要调整,它就回到 Canva 里接着改。 Phone Harness 更像是让 Agent 获得操作你 iPhone 的能力。 Airtap 对我更实用的一点是:我只负责把设计需求说清楚,真正进 Canva 执行的部分交给另一台云手机。

劳伦斯

120,499 views • 1 month ago

Damn,OpenAI刚刚扔出的这个开源仓库,直接把语音交互的未来砸到了所有人脸上🤯🤯🤯 他们发布了gpt-realtime-1.5的官方语音控制组件,现在你真的可以用自然语音,直接控制应用的UI状态,而不是转成文本再下命令。 视频里的演示蛮震撼的, 说一句切换深色模式, 整个界面瞬间变黑。 对着表单念你的姓名生日, 字段自动填充,进度条实时更新。 最绝的是下棋,说骑士走到F3,棋子直接移动,说重置棋盘,一秒清空, 就好像模型永远知道当前屏幕上是什么状态,语音操作和鼠标键盘完全等价。 讲真这么玩的话,这就不是简单的语音转文字的小升级了,我理解属于交互范式的真正转折。 以前语音是输入层,现在语音变成了应用的顶层控制层。 就是科幻电影里那种,对着屏幕说一句话,东西就自己变了的感觉🤩 更狠的是他们直接把整个实现开源了🤯🤯🤯 这个realtime-voice-component不是一个半成品demo,是一个完整的React参考实现。 一行代码加个浮动按钮,用Zod定义几个工具,十分钟就能给你现有的Web应用加上语音控制。 最聪明的设计是工具完全由应用拥有,模型只能调用你预定义的窄动作,不能乱动浏览器,安全又可控。 这比之前的Computer Use靠谱一万倍。 Computer Use是让AI瞎点屏幕,而这个是让AI直接调用你写好的接口。 一个是黑箱,一个是完全可控的白箱,这才是能真正落地到生产环境的方案。 现在已经有人用它接了蛋白结构可视化工具,接了设计软件,接了企业内部仪表盘。 未来你能想到的所有需要双手操作的场景,开车,做饭,做设计,做手术,未来都可以用语音控制。 这意味着语音正在成为操作系统级别的接口。 而OpenAI已经把所有的轮子都给你造好了。 想玩的直接去fork仓库,配个API Key,跑demo就能感受到那种说一句世界就变了的魔力。 老规矩GitHub地址评论区自取👇

AYi

121,770 views • 4 months ago

Microduck 本身只开源了microduck 和 microduck_rl,它在电脑上无法操控,不方便~ 于是乎,我耗费了一周的使用额度,做了个 microduck-studio 并开源了,希望以后玩 Microduck 的人,能少踩一点我踩过的坑。 开发机器人的时候,真正折磨人的很多时候不是代码,而是环境、端口、进程、socket、仿真和运行时散落在各处。服务明明都启动了,机器人就是不动,然后开始一个终端一个终端排查,这些坑我已经踩过一遍了,就没必要让后来的人再踩一遍,所以我做了三件事: ① 把开发环境串起来 Docker、robotd --sim、MuJoCo Viewer、Web 服务统一到一条可重复的一键启动链路里。 不用再开一堆终端,手动拼端口、socket 和进程。 ② 把状态直接摆出来 robotd、MuJoCo、策略、仓库状态都可以直接查看,也可以执行移动、停止和技能指令。 哪里出了问题,不用再靠猜。 ③ 把“启动成功”变成“真的能用” 服务启动后会继续做联通测试,真正发送控制指令,确认仿真机器人能够移动。 不是网页能打开就算成功,而是整条控制链路真的跑通。 microduck-studio 不替代 microduck,也不替代 microduck_rl。 它只是把原本零散的开发流程,整理成一个更容易使用、更容易排错的“本地控制室”。 如果它能让后来开发 Microduck 的人少踩几个坑、少开几个终端、少浪费几个小时排查问题,那这个项目就已经有价值了。 自己踩过的坑,顺手填上。 自己走通的路,给后来的人留个路标。 项目地址放评论区了 🔽

玉米_AlphaNotes

21,902 views • 13 days ago