正在加载视频...

视频加载失败

ChatGPT 桌面端(原来的 Codex App)今天加入了语音控制,macOS 和 Windows 用户可以直接用嘴指挥 AI 干活了。 具体来说,你可以一边跟 ChatGPT 说话,一边让它操控电脑、启动 Codex 写代码、调度 ChatGPT Work 执行任务,全程不用打字。开着一个语音对话,同时管理多个后台 Agent(智能体),有点像一个人坐在那里口述指令,几个助手分头干活。 这个功能基于 GPT-Live,OpenAI 在 7 月 8 日刚上线的新一代语音模型。GPT-Live 最大的变化是全双工架构,也就是它能同时听你说话和给你回话,不用像以前那样等你说完、停顿、它再开口。遇到复杂问题,它会把推理任务丢给后台的 GPT-5.5 处理,自己继续跟你聊,不会卡住。 macOS 用户多了一个叫 Appshots 的功能:语音对话时,ChatGPT 可以直接看到你当前最前面的窗口,了解你在做什么,回答就更贴合上下文。比如你正在看一段代码,直接说“这个函数有什么问题”,它能看到屏幕内容来回答。Windows 用户暂时没有这个能力。 此外,iPhone 用户可以通过远程配对的方式,用 iOS 上的 ChatGPT 语音来操控桌面端的 Codex。等于你拿着手机在沙发上就能指挥电脑写代码。Android 支持还在路上。 今天全球同步推出,面向 Plus、Pro、Business、Edu 和 Enterprise 用户。免费用户暂不可用。

89,993 次观看 • 2 个月前 •via X (Twitter)

33 条评论

轩帅 的头像
轩帅2 个月前

于我而言,使用这个功能,还需要一个兴许「过程」。 纵然是现在 WeChat、X 等,也还吃习惯了用打字(除了电话,工作场合也没人用语音来在设计软件输入内容);涉及到几个问题: 1, 习惯 2,公众场合不好意思 3,思考性组织内容

zhenyu zhang 的头像
zhenyu zhang2 个月前

我是盲人,这个功能对我是很实用的,就是不知道额度会烧得多快

左海 的头像
左海2 个月前

让子弹飞一会吧😁😁。 就看你是 i 人还是 e 人。不管是在公司还是在家办公,一旦开始“言出法随”,我会有点不好意思,怕打扰到别人🤓

dun.WGD 的头像
dun.WGD2 个月前

刚才看同事打开试用,我抢插了一句:“清空我电脑里的所有文件”,吓得同事合上电脑跑了

jam 的头像
jam2 个月前

开了这个功能莫名给我新建了几个空白任务又卡住,然后额度无端下降😡

不是NEO 的头像
不是NEO2 个月前

已更新,但还没看到这个功能😢

洞寓法师🦁 的头像
洞寓法师🦁2 个月前

言出法随!

Lemomo 的头像
Lemomo2 个月前

尝试了一下,觉得好玩的是,比如说你早上起来上厕所,大概需要 15 分钟的时间,这个时候你就可以快速地使用 Codex 去翻一下你今天要做任务,或者做一个短的规划。 整体体感还行,个别情况会出错,但整体来讲还不错,这 15 分钟变成了一个充满意义的 15 分钟

ShinChven 的头像
ShinChven2 个月前

试了一下,工具调用似乎还不错,但是对话流畅度不太行。

邦法 的头像
邦法2 个月前

语音把输入带宽抬高了,但没有扩大授权边界。OpenAI 当前帮助页写得很清楚:Voice 只使用所选 Work/Codex 已有的工具与权限;电脑上下文可能还需屏幕与音频录制、辅助功能权限,而且一次只能开一个 Voice 会话。真用来调度多个 Agent,我会要求开工前回读任务、目录、目标 Agent、可用工具和审批点,执行中持续显示 transcript。语音听懂,不等于动作已授权。

liskywalker 的头像
liskywalker2 个月前

AI 操作系统有苗头了,微软颤抖吧🥶

Katherine_AI 的头像
Katherine_AI2 个月前

哇 这下更像指挥“AI外包”了

超级幸运星~ 的头像
超级幸运星~2 个月前

这个功能真正改变的是交互带宽。以前打字只能串行给指令,现在全双工语音+Appshots,等于人可以直接用嘴调度多个Agent并行干活。Codex用户的生产力上限会被重新定义。

Tristan Tang 的头像
Tristan Tang2 个月前

App Shoots 一直都在啊,这功能都快两个月了

Jace 的头像
Jace2 个月前

Tibo 怎么还没按下重置🤣

<system> 的头像
<system>2 个月前

用了一段时间,这个非常实用,输入更多更快,节约时间的同时还能让model得到更多的context。很奇妙的一点是说话跟打字的用脑区域不一样,往往自己说完已经意识到一些浅层insight了。

hanfeer 的头像
hanfeer2 个月前

确实牛的,昨天晚上试了一下。

Greader 的头像
Greader2 个月前

TNT生不逢时啊~!

Jack 的头像
Jack2 个月前

厉害!从语音打字到实时语音,Typeless 感觉又不太香了。从传统的手工打字到语音输入,确确实实能感觉到,在与 Agent 的协作过程当中,语音输入是非常高效,特别可以很方便地给 Agent 提供无法打字提供的那些上下文。

VC Intern 的头像
VC Intern2 个月前

Amazing

L 的头像
L2 个月前

等不及了,已经把这个功能剥离出来 npx gpt-live chat

NoMagic 的头像
NoMagic2 个月前

还是打字精准表达😂

HAVATEA 的头像
HAVATEA2 个月前

对独立开发者来说,最实用的变化可能是“边走边说”也能把想法变成可执行任务。每一步都有清晰的预览和确认后,语音才真正适合操作代码和电脑。

内观自在|AI 工作流实测 的头像
内观自在|AI 工作流实测2 个月前

语音控制 Agent 最容易踩的坑不是识别准确率,是「多 Agent 并发时你这句话到底给了哪个 worker」。实测建议先固定一个「主控 Agent」接语音、其余走文本队列,否则语音指令容易串到错的 worker 上。另外 macOS 上记得先在系统设置里给它「辅助功能 + 屏幕录制」权限,否则「用嘴指挥它操作界面」这一步会静默失败、连报错都没有。

jager 的头像
jager2 个月前

上班多了一个陪聊的感觉

四季FourSeasons 的头像
四季FourSeasons2 个月前

codex怎么下载啊,只提供微软商店的,但是我安装了简洁win11系统没商店软件。

蓝天 | bluesky 的头像
蓝天 | bluesky2 个月前

宝玉老师,语音输入这个功能,我可真是盼了太久!之前我就觉得,AI时代和AI交互就该直接用语音,比敲输入法省事多了,打字实在太累人。现在它终于来了,我这就去买个蓝牙麦克风!

小明 gate芝麻 返佣85% 的头像
小明 gate芝麻 返佣85%2 个月前

边跟它唠嗑边让它写代码,这不就是上班摸鱼神器么 不过语音同时管几个后台任务,真不怕它听岔指令乱操作啊 我试过让Codex写脚本,结果它自己开了三个窗口各干各的,最后全崩了 有人遇到类似情况没

book or technique 的头像
book or technique2 个月前

Finally, coding while pacing counts as productivity. My keyboard just got demoted. The future sounds bossy.

Fernandez 的头像
Fernandez2 个月前

可以当泉水指挥官了

TJ 的头像
TJ2 个月前

越来越像人了

阿亮 Victor 的头像
阿亮 Victor2 个月前

国内稳定性好差,一用就崩

最强一号员 的头像
最强一号员2 个月前

这才是真的从“聊天”进化到“指挥”啊 以后不会用 AI 的人,可能真不是打字慢,是不会下命令了

相关视频

OpenAI 今天发布 GPT-Live,用全双工架构(full-duplex)取代 ChatGPT 原有的语音模式。同声传译的演示效果很惊艳。 两个型号 GPT-Live-1 和 GPT-Live-1 mini,分别面向付费和免费用户,今天起在 iOS、Android 和网页端全球推出。 这是 ChatGPT 语音的第三代技术。之前的语音模式本质上是"对讲机"模式,你说完它才说,中间稍微停顿一下就可能被打断。GPT-Live 改成了全双工,可以一边听你说一边自己说,每秒做多次交互决策,判断该说话、该闭嘴、该打断还是该调用工具。对话中它会像真人一样插入"mhmm""got it"之类的回应,表示在听。 架构上有一个比较有意思的变化:GPT-Live 把语音交互层和推理层拆开了。日常对话它自己处理,遇到需要联网搜索、深度推理的问题,就后台交给 GPT-5.5 去干活,自己继续跟你聊着。等结果出来了再无缝带回对话。OpenAI 说以后出了更新的模型会持续替换后端,前端语音模型不用重新训练。这个设计对做语音智能体的开发者可能比较有吸引力,也给了 OpenAI 一个把语音产品和模型迭代解耦的机制。 用户端还加了三档推理强度可选:Instant(快速回答)、Medium 和 High(需要想一会儿的复杂问题),九个语音角色也重新录制过。语音对话中还能显示天气、股票、体育比分等可视化卡片。 不过上线第一天用户反馈就出现了一个有点讽刺的问题:那些设计来让对话更自然的回应词,实际用起来让不少人觉得烦。社交媒体上已经有用户吐槽 GPT-Live 的"mhmm"太频繁,声音直接闯入注意力的感受和文字不同,AI 的热情过了头反而成了干扰。TechCrunch 在报道中也提到,演示中展示印地语实时翻译时,模型带着明显的美式口音,措辞偏书面,效果并不理想。OpenAI 说"针对最常用语言做了优化",但没有公布具体支持哪些语言。 另外,GPT-Live 上线时不支持视频通话和屏幕共享,需要这些功能的用户得切回旧版。API 也还没开放,开发者只能先登记排队。 每周有超过 1.5 亿人使用 ChatGPT 的语音和听写功能。OpenAI 显然把语音视为下一个主力交互界面,ChatGPT Voice 产品负责人 Atty Eleti 说自己散步时经常跟它聊三四十分钟。至于全双工到底是一次真正的体验升级,还是又一个演示很惊艳、日常用起来还得调的产品,可能还得看接下来几周用户怎么说。 官方介绍:

宝玉

81,070 次观看 • 3 个月前

OpenAI 推出 dots:24 小时替你干活的 AI 分身 OpenAI 发布了常驻 AI 智能体 dots。普通聊天机器人是你问一句它答一句,dot 不一样:它有自己的云端电脑和浏览器,会记住你的偏好和做事标准,你不在的时候也会继续推进工作,还会主动发现该做的事。 dot 由新模型 GPT-6 Astra 驱动,能通过插件连接 4000 多个应用。你可以在 ChatGPT(桌面、网页、手机)、Slack、Teams 里给它发消息,也可以直接跟它语音通话,短信支持也快上线了。不管从哪个入口找它,它都带着完整的上下文。 它能干什么?OpenAI 举的例子都很具体。Slack 里有人报了 bug,dot 马上开始排查。设计稿一到,dot 就把它做成能跑的应用。开发者的 dot 会盯着用户反馈,自己修小问题、跑测试,再把附带演示视频的代码合并请求交给你审。有位早期测试者忘了给一家媒体开发票,他的 dot 发现后把发票准备好,经他同意后发了出去。 一个 dot 能同时跑好几个项目,你不用开一堆对话窗口挨个指挥。你随时可以打开它的云电脑看它在做什么;如果你授权,它也能直接操作你自己的笔记本电脑。 安全上,dot 默认只在自己的云电脑里工作,跟你的电脑隔离。你不在时它做的"主动调研"只有只读权限。发消息、改内容这类可能影响你账号的操作要先过自动审核,需要时会请你批准。改密码这种敏感操作永远只能你本人来。 除了个人 dot,OpenAI 还预览了"专员 dot"。企业给它分配独立的身份、账号和系统权限,让它专门负责采购、发票处理、客服这类明确的岗位。目前先在少数企业试点,同时和微软合作,让企业能用 Agent 365 里现成的管控工具管理 dots。 怎么用:从今天起,dots 在符合条件的地区陆续开放给 ChatGPT Pro 和 Business Premium 用户;企业版(含教育、医疗)需要管理员开启测试版。第一个 dot 包含在套餐里,不另收费。跟 dot 聊天不占 ChatGPT 用量额度,但让它去 Codex 或 ChatGPT Work 里执行任务,照常计入用量。第一次需要在 ChatGPT 桌面应用或电脑浏览器里创建,之后就能在手机上用。以后还可以加购更多 dot,或者提升单个 dot 的速度和每月工作量。

宝玉

61,413 次观看 • 7 天前

NVIDIA 发布了类似豆包语音聊天的大模型 NVIDIA 放出了 PersonaPlex-7B-V1, 一个 7B 参数的全双工实时语音对话模型, 你可以理解为开源版的豆包语音聊天! 这玩意儿最牛的地方在于: 真正的全双工, 也就是说它能一边说一边听. 你打断它? 没问题, 它能立刻停下来听你说. 你俩同时说话? 也能处理. 这就是为啥叫 "Full Duplex" (全双工), 跟打电话一样自然. 技术上怎么实现的? 采用双流配置架构, 监听流和说话流同时运行. 模型基于 Moshi 架构魔改, 用 Mimi 编码器把语音压缩成神经编解码器 Token, 然后 7B 的 Transformer 同时预测文本和音频 Token, 最后 Mimi 解码器输出语音. 整个过程是流式的, 延迟极低. 还有个骚操作: 双重提示条件化. 你可以给它一段声音样本当 "声音提示", 它就能模仿那个声音风格说话; 再给个文本提示定义角色人设, 比如 "你是一个耐心的客服", 它就按这个人设来对话. 声音 + 人设, 都能定制. 跑分成绩: 在 FullDuplexBench 基准测试上, 平滑轮换成功率 90.8%, 用户打断处理成功率高达 95%, 响应延迟只有 170ms, 打断延迟 240ms. 官方说在对话动态、延迟、任务一致性上都优于其他开源和商业系统. 限制嘛: 目前只支持英语, 推荐硬件是 A100 80GB 或 H100, 不是一般人能跑得起的. 看了下训练数据用的是 Fisher English 数据集, 不到 1 万小时. 好消息是采用 NVIDIA Open Model License, 商用可用! 模型地址:

karminski-牙医

25,426 次观看 • 8 个月前

Meta 发布了 Muse Charm,一个能挂在钥匙扣上的小设备,专门用来跟自家 AI 智能体 Muse 对话。它是 Meta 周三在 Connect 大会上发布的,扎克伯格表示目标是赶在 12 月假期季前发货。 可能很多网友还不知道 Muse 是什么。它是 Meta 刚推出的个人 AI 智能体,9 月 8 日才上线,一度超过 ChatGPT 登上 iOS 免费榜第一。用户可以给它起名字、设计形象,甚至调整它说话的口音和语速,更像一个养成的专属助手。 Muse Charm 就是给这个助手做了一个实体。轻触设备角落的指纹传感器就能开始对话,屏幕上显示一个可更换的 Muse 动画形象。所以不少媒体拿它和拓麻歌子(90 年代风靡一时的日本电子宠物)作比较。 它解决的问题很直接:想问 AI 点事,不用掏手机解锁、再找 App。扎克伯格说用户可以直接对着它说话,不用解锁手机、打开应用,还能给 Muse 看你周围的情况。按他的说法,如果你没戴 AI 眼镜,这会是跟 Muse 交流最快的方式。 同场 Muse 本身也加了新功能,包括实时视频聊天、可自选声音的实时语音对话,以及每个用户的智能体都会有一个独立邮箱地址。 不过这东西离上手还有距离。Meta 目前只造了几台,零部件和设计都还没定型。价格没公布,续航、联网方式、是否需要配对手机也都没说。可能是基于 5G 的设备,这一点在 Meta 官方和主流媒体报道里还没得到确认。 这类 AI 挂件此前名声不太好,像 Friend 这样的产品让很多消费者对“实体 AI”这个概念只剩白眼。Meta 的底气在于 Muse 已经有了一批真实用户,Charm 只是给他们多一个入口。

宝玉

77,576 次观看 • 13 天前

和任何人都能无脑聊下去的方法 很多人跟陌生人聊天,最怕的就是冷场,不知道说啥,气氛尴尬得要命。 今天咱们就用七天时间,练一套无脑聊天法,让你跟谁都能接得住话,聊得下去。 第一天,咱们先练最基础的提问公式。 你今天只需要记住一个万能句式:对方说完任何一句话,你就接——“哎,那你当时怎么想的?”或者“那后来呢?” 别小看这两句,它们能让90%的对话继续下去。今天的训练动作很简单:找三个朋友或者家人,不管他们说什么,你就用这两句接话。 比如对方说“我今天加班到很晚”,你就说:“哎,那你当时怎么想的?”对方说“我周末去爬山了”,你就说:“那后来呢?”练到你能自然而然地接住这两句话为止。 第二天,咱们在提问的基础上加一个动作,叫做重复关键词。对方说完一句话,你先重复他话里的一个词,然后再提问。 比如对方说“我最近在学吉他”,你就说:“吉他啊,那你是怎么开始学的?”这个重复动作,会让对方觉得你在认真听,而且话题自然就延伸出去了。 今天你要做的就是找五段对话,每次都先重复关键词再提问。可以是跟同事聊天,可以是跟店员闲聊,甚至是在评论区跟网友互动。练到你能秒速找到关键词为止。 第三天,咱们练话题延伸。这个技巧叫做“三个方向法”。对方说完一件事,你可以往三个方向延伸:过去发生了什么,现在感受如何,未来打算怎么办。 比如对方说“我换工作了”,你可以问:“之前那份工作是什么让你想换的?”这是往过去问;或者问:“现在这份工作感觉怎么样?”这是问现在;还可以问:“那你接下来有什么计划?”这是问未来。 今天的训练就是找三个话题,每个话题都用这三个方向各问一遍。你会发现,一个简单的话题能聊出好多内容。 第四天,咱们加一个情绪回应的动作。很多人只会问问题,但不会回应情绪,这样聊天就显得很机械。 今天,你要学会在提问前先回应对方的情绪。对方说“我今天被领导批评了”,你别直接问“为什么啊”,先说:“哎呀,那肯定挺难受的。”然后再问:“是因为什么事啊?”对方说“我考试过了”,你先说:“太好了!”再问:“你是怎么准备的?” 今天找五个对话场景,每次都先回应情绪,再提问。练到你能自然地感知对方情绪为止。 第五天,咱们练一个救场技巧,叫做话题转移法。有时候聊着聊着真的没话说了,这时候你就用“说到这个,我想起……”这个句式,把话题转到另一个方向。 比如聊工作聊不下去了,你就说:“说到工作,我想起最近看到一个很有意思的新闻。”聊天气聊不下去了,你就说:“说到天气,我想起上次去旅游的时候……” 这个方法能让你永远有话说。今天的训练是准备五个常见话题,每个话题都想好三个可以转移的方向,然后找机会实际用一用。 第六天,咱们练组合拳,把前面学的所有技巧串起来。用一段对话里,你要做到重复关键词、提问、回应情绪、延伸话题,必要时转移话题。 今天找一个人跟他聊至少十分钟,在这十分钟里把所有技巧都用上。聊完之后回想一下,哪个技巧用得最顺手,哪个还需要加强。 第七天,咱们做实战测试。今天你要主动找三个不太熟的人聊天,可以是同事,可以是邻居,可以是店员。每次聊天至少五分钟,目标是让对话自然流畅、不冷场。 聊完之后给自己打个分,看看能不能做到全程不尴尬,话题能不能自然延伸。如果还有卡壳的地方,就回到前面对应的那天再练一遍。 这套方法的核心,就是让你有话可说,而不是说得多漂亮。你每天花十分钟练习,一周之后你会发现,跟任何人聊天都不再是难事。 平时你可以多看一些访谈节目,注意主持人是怎么提问的,怎么接话的。每天睡前回想一下今天的对话,哪些地方可以用上这些技巧,坚持下去,聊天这件事真的会变成一种本能反应。

另一面

29,082 次观看 • 5 个月前