Loading video...

Video Failed to Load

Go Home

33秒的视频--新版 ChatGPT Codex 侧边栏 + 电脑操控演示(含避坑指南) Codex 更新了 Chrome 浏览器插件(侧边栏),现在直接可以在浏览器打开CodeX的侧边栏工作,支持电脑操控。AI 可自动模拟真实浏览器操作:打开页面、点击、读取内容、抓取数据等,提升了网页交互能力,模仿真人的操作 接下来我手把手教你怎么设置,以及怎么避坑: 1. 先设置权限(关键,很多人都卡在这里): 打开 Codex 设置 → 电脑操控 开启 Google Chrome,确认显示 已连接(绿色小点) 🌟连接不上或无法运行 → 换 VPN 节点;换节点还不行,就让 Codex 检查本地是否有残留的其他浏览器操作插件(如 OpenCLI),清理后即可。我实测有效 2. 设置完成后,在浏览器直接打开 ChatGPT / Codex 侧边栏 进行对话,即可操纵浏览器 我的视频操作是,直接在CodeX侧边栏输入: “帮我直接在小红书搜索 CODEX 相关内容,找到5个点赞比较高的作品,每个作品再抓5条热门评论。最后帮我总结大家在关心什么、吐槽什么、想知道什么。” AI 通过 Chrome 集成技术自动读取搜索结果,打开高赞笔记,抓取评论区,输出结构化总结(安装、费用、国内使用限制、实际用法等讨论点) 整体用下来还是比较丝滑的,没有遇到什么卡点 适用场景: 各种网页平台内容抓取与分析(包括小红书、X、LinkedIn、电商平台、论坛等)、UI...

28,542 views • 1 month ago •via X (Twitter)

0 Comments

No comments available

Comments from the original post will appear here

Related Videos

Codex 操控电脑的三种方式。Codex 团队成员 Jason 今天写了一篇详细指南,把三者的区别和适用场景理清楚了,这里做个精简版。 【1】Computer Use:最广,也最慢 Computer Use 让 Codex 像人一样看屏幕、点鼠标、敲键盘,操作你电脑上的任何图形界面应用。Spotify、Xcode、系统设置、iOS 模拟器,甚至 iPhone Mirroring 都能控制。 代价是慢。结构化插件可以直接调 API,Computer Use 得一步步看界面、找按钮、等响应、再检查结果。但它能搞定没有 API 的应用,这是其他方式做不到的。 Mac 和 Windows 的体验差距很大:Mac 上 Codex 可以在后台静悄悄地操作,你继续用自己的电脑不受影响;Windows 上它必须占据前台,操作期间你没法用那台机器。 Jason 举了个例子:有次他的快递被偷了,Amazon 说要等 25 分钟才能接通客服。他让 Codex 每五分钟检查一次聊天窗口,客服出现后改为每分钟一次,自动完成退款流程。他去洗了个澡,回来退款已经办好了。 【2】Chrome 扩展:带着你的登录状态 Chrome 扩展让 Codex 使用你已登录的浏览器会话,包括 cookies、账号状态和已有标签页。Gmail、LinkedIn、Salesforce、公司内部后台,这些需要登录才能用的工具,Chrome 扩展是对的选择。 它还能同时控制多个标签页,在一个标签里读信息,到另一个标签里对比,再到第三个标签完成操作。Computer Use 也能操作浏览器,但它只认屏幕坐标,Chrome 扩展理解的是浏览器层面的上下文。 Jason 用它跑了一个长期任务:每天让 Codex 通过 Chrome 检查他的 Twitter 私信、浏览相关新闻、收集反馈,把有价值的内容存到本地文件,但不发任何消息。 要注意的是,网站会把 Codex 的点击和表单提交当作你本人的操作。研究、浏览、起草可以自动化,但发送、发布、付款这类操作最好留给自己确认。 【3】内置浏览器:给开发者的沙盒 内置浏览器住在 Codex 的对话线程里,你和 Codex 共享同一个渲染页面。它不带任何登录状态和 cookies,是个完全隔离的环境。 这反而成了开发场景的优势。它的主场是本地开发服务器、文件预览、公共网页、响应式布局检查和视觉 bug 复现。Codex 可以改代码、操作页面、截图、再跑一遍,形成紧密的反馈循环。 Jason 最喜欢的功能是标注:你可以直接在页面上点击某个元素留评论,比如"这个层级反了""这个按钮间距不够",Codex 会拿着截图和元素上下文去改代码,改完重新打开同一个页面等你下一轮标注。比来回传截图和文字描述高效得多。 【选哪个?】 简单记:任务需要登录状态用 Chrome,需要操作桌面应用用 Computer Use,在做前端开发用内置浏览器。如果有现成的插件或 MCP 能完成任务,优先用结构化工具,视觉控制是最后手段。

宝玉

185,195 views • 2 months ago

有个朋友最近想去 Threads 做账号。 内容方向他已经想好了,真正让他头疼的,是每天去哪里找热点,怎么整理素材,写完以后又怎么稳定发布。 我给他的建议很直接: 先用 EasyClaw 跑一套自动化。 刚好 EasyClaw EasyClaw 最近更新了 RPA 自动化,我也顺手拿这个需求实际测试了一遍。 最后做出来的效果是: Google Trends 获取热点 → 生成 Threads 文案 → 按照间隔逐条发布 整个过程比我原本想象中简单很多。 现在它也支持其他的平台实现自动化,感兴趣的可以去试试 首充用码 MJLH8QY7 可以享 95 折,每天 200 免费额度足够搭好几条监控了。 ////////////////////////// EasyClaw EasyClaw 需要从官推进入官网,再下载安装到电脑上,它目前并不是一个直接打开网页就能使用的 Web 工具。 因为后面会涉及浏览器操作、本地脚本和账号登录状态,我个人更建议安装在虚拟机,或者单独准备的 VPS 里。 一方面环境比较干净,可以减少其他软件和浏览器插件的干扰。 另一方面也能把自动化任务和自己的主力电脑隔离开,用起来会安心一些。 安装完成之后,找到里面的 automation-rpa Agent,就可以直接描述需求。 ////////////////////////// 我最开始给出的需求很简单(我把教程图贴了出来,我也把做好之后的运行视频录制了一下,大家可以看看): “帮我做一个 Threads 运营工具,从 Google Trends 获取热点,再生成搞笑和 Crypto 方向的内容。” EasyClaw 会先确认热点来源、生成数量、发布方式和运行频率。 我选择抓取 5 个热点,生成 3 条内容,先保存草稿,确认没有问题以后再升级成自动发布。 接下来基本不用自己研究页面结构。 EasyClaw 会打开 Google Trends,处理弹窗,等待页面加载,找到热点列表并提取数据。 热点拿到以后,再按照提前设置好的方向生成 Threads 文案,并把结果保存到 Excel。 第一次运行时,可以先用少量数据试跑。 整套流程确认正常以后,再让它打开已经登录的 Threads,自动找到发帖入口、填写内容,并按照设置好的间隔逐条发布。 热点数量、内容方向、发布条数、间隔时间和文件路径,后面都可以直接修改。 第一次把流程做好,之后换一个话题、换一种文案风格,也能继续复用。 ////////////////////////// 最后生成的也不是一个只能在 EasyClaw 里运行的封闭任务。 整个流程会被整理成标准的 Python 脚本。 懂代码的人,可以打开 继续增加功能,接入新的数据源或者 AI API。 不懂代码的人,也可以直接调整参数运行。 后面还可以加入定时调度。 比如每天固定时间抓一次热点,生成几条内容,先保存草稿,或者直接发布到 Threads ////////////////////////// 这次实际用下来,EasyClaw 给我最明显的感受,就是做自动化的门槛确实被压低了。 以前想做一套类似的流程,可能要自己研究 Selenium、DOM 结构、浏览器驱动和各种报错。 现在只需要把需求尽量说清楚。 页面怎么打开,按钮在哪里,数据怎么提取,最后怎么整理成脚本,可以让 Agent 自己往下探索。 而且生成出来的任务还可以参数化。 今天用来做 Threads,明天换成抓取其他网站、整理资料或者批量处理一些重复工作,前面的思路都可以继续复用。 所以我愿意把 EasyClaw 理解成: 一个能操作真实浏览器,也能把操作写成脚本的 AI 助手。 你负责提出需求和检查结果。 中间那些重复、机械,又很浪费时间的操作,可以慢慢交给它。 我朋友原本只是想做一个 Threads 账号。 最后我们顺手给他搭出了一条能够反复运行的内容生产线。

Mr.理想三旬(🌸,🍃)(FREE,WON)

13,675 views • 1 month ago

一个放在桌面上或者户外的 AI Agent 控制小方盒:用语音、按键、小屏,去控制电脑/远程服务器、调用所有工具、执行任务 在做这个产品的时候有做过调研,现在市面上大都是纯对话的语音AI Hermes Studio 小方盒 可以做什么 ? (视频演示) 1. 控制电脑 /远程服务器 小方盒本身是 ESP32,但它可以作为入口,把指令交给 Hermes Studio 在电脑 /远程服务器 上执行。 (它就是Hermes Agent) 可以做: 打开/关闭本地应用或网页 在电脑/远程服务器 上运行命令 读取、搜索、整理本地文件 上传文件给 Agent 分析 下载 Agent 生成的文件 控制浏览器访问网页、查资料、填表、抓取信息 调用本地 Coding Agent,让它改代码、跑测试、生成项目 查看运行日志、任务状态、错误信息 用语音触发“帮我总结这个文件夹”“打开今天的任务”“跑一下测试” 2. 调用工具 (生产力有待研究) Hermes Studio 的核心优势是 Agent 工具链。小方盒可以作为物理触发器,让 Agent 调用工具。 文件工具:浏览文件、搜索文件、读取内容、上传下载、重命名、复制、移动、删除。 终端工具:执行 shell 命令、启动服务、查看进程、跑脚本、拉代码、跑测试。 浏览器工具:打开网页、搜索资料、读取网页内容、自动化页面操作。 代码工具:启动 Codex / Claude Code 等 coding-agent 会话,做代码修改、调试、检查。 MCP 工具:接入外部系统,比如数据库、知识库、Notion、GitHub、邮件、企业内部 API、智能家居等。 语音工具:STT 语音转文本,TTS 回复朗读,多种 TTS Provider。 自动化工具:定时任务、周期汇报、监控任务、Kanban 工作项。 多平台工具:Telegram、Discord、Slack、WhatsApp、Matrix、飞书、微信、企业微信等渠道。 一句话:小方盒不是自己完成所有任务,而是唤醒 Hermes Studio 里的工具系统。 产品功能: 语音唤醒桌面 Agent 实体按键触发 本地文件读取、搜索与整理 电脑/远程服务器命令执行与任务自动化 浏览器自动化与网页信息获取 Coding Agent 启动 MCP 工具扩展,连接外部服务 多模型、多 Profile 切换 多平台消息接入 TTS/STT 语音输入输出 Nous Research witcheer Teknium 🪽 Hermes community never disappoints! 👀

libapi

31,786 views • 2 months ago