Video yükleniyor...

Video Yüklenemedi

Ana Sayfaya Dön

ChatGPT 桌面端(原来的 Codex App)今天加入了语音控制,macOS 和 Windows 用户可以直接用嘴指挥 AI 干活了。 具体来说,你可以一边跟 ChatGPT 说话,一边让它操控电脑、启动 Codex 写代码、调度 ChatGPT Work 执行任务,全程不用打字。开着一个语音对话,同时管理多个后台 Agent(智能体),有点像一个人坐在那里口述指令,几个助手分头干活。 这个功能基于 GPT-Live,OpenAI 在 7 月 8 日刚上线的新一代语音模型。GPT-Live 最大的变化是全双工架构,也就是它能同时听你说话和给你回话,不用像以前那样等你说完、停顿、它再开口。遇到复杂问题,它会把推理任务丢给后台的 GPT-5.5 处理,自己继续跟你聊,不会卡住。 macOS 用户多了一个叫 Appshots 的功能:语音对话时,ChatGPT 可以直接看到你当前最前面的窗口,了解你在做什么,回答就更贴合上下文。比如你正在看一段代码,直接说“这个函数有什么问题”,它能看到屏幕内容来回答。Windows 用户暂时没有这个能力。 此外,iPhone 用户可以通过远程配对的方式,用 iOS 上的 ChatGPT 语音来操控桌面端的 Codex。等于你拿着手机在沙发上就能指挥电脑写代码。Android 支持还在路上。 今天全球同步推出,面向 Plus、Pro、Business、Edu 和 Enterprise 用户。免费用户暂不可用。

87,924 görüntüleme • 27 gün önce •via X (Twitter)

0 Yorum

Yorum bulunmuyor

Orijinal gönderinin yorumları burada görünecek

Benzer Videolar

OpenAI 今天发布 GPT-Live,用全双工架构(full-duplex)取代 ChatGPT 原有的语音模式。同声传译的演示效果很惊艳。 两个型号 GPT-Live-1 和 GPT-Live-1 mini,分别面向付费和免费用户,今天起在 iOS、Android 和网页端全球推出。 这是 ChatGPT 语音的第三代技术。之前的语音模式本质上是"对讲机"模式,你说完它才说,中间稍微停顿一下就可能被打断。GPT-Live 改成了全双工,可以一边听你说一边自己说,每秒做多次交互决策,判断该说话、该闭嘴、该打断还是该调用工具。对话中它会像真人一样插入"mhmm""got it"之类的回应,表示在听。 架构上有一个比较有意思的变化:GPT-Live 把语音交互层和推理层拆开了。日常对话它自己处理,遇到需要联网搜索、深度推理的问题,就后台交给 GPT-5.5 去干活,自己继续跟你聊着。等结果出来了再无缝带回对话。OpenAI 说以后出了更新的模型会持续替换后端,前端语音模型不用重新训练。这个设计对做语音智能体的开发者可能比较有吸引力,也给了 OpenAI 一个把语音产品和模型迭代解耦的机制。 用户端还加了三档推理强度可选:Instant(快速回答)、Medium 和 High(需要想一会儿的复杂问题),九个语音角色也重新录制过。语音对话中还能显示天气、股票、体育比分等可视化卡片。 不过上线第一天用户反馈就出现了一个有点讽刺的问题:那些设计来让对话更自然的回应词,实际用起来让不少人觉得烦。社交媒体上已经有用户吐槽 GPT-Live 的"mhmm"太频繁,声音直接闯入注意力的感受和文字不同,AI 的热情过了头反而成了干扰。TechCrunch 在报道中也提到,演示中展示印地语实时翻译时,模型带着明显的美式口音,措辞偏书面,效果并不理想。OpenAI 说"针对最常用语言做了优化",但没有公布具体支持哪些语言。 另外,GPT-Live 上线时不支持视频通话和屏幕共享,需要这些功能的用户得切回旧版。API 也还没开放,开发者只能先登记排队。 每周有超过 1.5 亿人使用 ChatGPT 的语音和听写功能。OpenAI 显然把语音视为下一个主力交互界面,ChatGPT Voice 产品负责人 Atty Eleti 说自己散步时经常跟它聊三四十分钟。至于全双工到底是一次真正的体验升级,还是又一个演示很惊艳、日常用起来还得调的产品,可能还得看接下来几周用户怎么说。 官方介绍:

宝玉

79,384 görüntüleme • 1 ay önce

NVIDIA 发布了类似豆包语音聊天的大模型 NVIDIA 放出了 PersonaPlex-7B-V1, 一个 7B 参数的全双工实时语音对话模型, 你可以理解为开源版的豆包语音聊天! 这玩意儿最牛的地方在于: 真正的全双工, 也就是说它能一边说一边听. 你打断它? 没问题, 它能立刻停下来听你说. 你俩同时说话? 也能处理. 这就是为啥叫 "Full Duplex" (全双工), 跟打电话一样自然. 技术上怎么实现的? 采用双流配置架构, 监听流和说话流同时运行. 模型基于 Moshi 架构魔改, 用 Mimi 编码器把语音压缩成神经编解码器 Token, 然后 7B 的 Transformer 同时预测文本和音频 Token, 最后 Mimi 解码器输出语音. 整个过程是流式的, 延迟极低. 还有个骚操作: 双重提示条件化. 你可以给它一段声音样本当 "声音提示", 它就能模仿那个声音风格说话; 再给个文本提示定义角色人设, 比如 "你是一个耐心的客服", 它就按这个人设来对话. 声音 + 人设, 都能定制. 跑分成绩: 在 FullDuplexBench 基准测试上, 平滑轮换成功率 90.8%, 用户打断处理成功率高达 95%, 响应延迟只有 170ms, 打断延迟 240ms. 官方说在对话动态、延迟、任务一致性上都优于其他开源和商业系统. 限制嘛: 目前只支持英语, 推荐硬件是 A100 80GB 或 H100, 不是一般人能跑得起的. 看了下训练数据用的是 Fisher English 数据集, 不到 1 万小时. 好消息是采用 NVIDIA Open Model License, 商用可用! 模型地址:

karminski-牙医

25,426 görüntüleme • 6 ay önce

和任何人都能无脑聊下去的方法 很多人跟陌生人聊天,最怕的就是冷场,不知道说啥,气氛尴尬得要命。 今天咱们就用七天时间,练一套无脑聊天法,让你跟谁都能接得住话,聊得下去。 第一天,咱们先练最基础的提问公式。 你今天只需要记住一个万能句式:对方说完任何一句话,你就接——“哎,那你当时怎么想的?”或者“那后来呢?” 别小看这两句,它们能让90%的对话继续下去。今天的训练动作很简单:找三个朋友或者家人,不管他们说什么,你就用这两句接话。 比如对方说“我今天加班到很晚”,你就说:“哎,那你当时怎么想的?”对方说“我周末去爬山了”,你就说:“那后来呢?”练到你能自然而然地接住这两句话为止。 第二天,咱们在提问的基础上加一个动作,叫做重复关键词。对方说完一句话,你先重复他话里的一个词,然后再提问。 比如对方说“我最近在学吉他”,你就说:“吉他啊,那你是怎么开始学的?”这个重复动作,会让对方觉得你在认真听,而且话题自然就延伸出去了。 今天你要做的就是找五段对话,每次都先重复关键词再提问。可以是跟同事聊天,可以是跟店员闲聊,甚至是在评论区跟网友互动。练到你能秒速找到关键词为止。 第三天,咱们练话题延伸。这个技巧叫做“三个方向法”。对方说完一件事,你可以往三个方向延伸:过去发生了什么,现在感受如何,未来打算怎么办。 比如对方说“我换工作了”,你可以问:“之前那份工作是什么让你想换的?”这是往过去问;或者问:“现在这份工作感觉怎么样?”这是问现在;还可以问:“那你接下来有什么计划?”这是问未来。 今天的训练就是找三个话题,每个话题都用这三个方向各问一遍。你会发现,一个简单的话题能聊出好多内容。 第四天,咱们加一个情绪回应的动作。很多人只会问问题,但不会回应情绪,这样聊天就显得很机械。 今天,你要学会在提问前先回应对方的情绪。对方说“我今天被领导批评了”,你别直接问“为什么啊”,先说:“哎呀,那肯定挺难受的。”然后再问:“是因为什么事啊?”对方说“我考试过了”,你先说:“太好了!”再问:“你是怎么准备的?” 今天找五个对话场景,每次都先回应情绪,再提问。练到你能自然地感知对方情绪为止。 第五天,咱们练一个救场技巧,叫做话题转移法。有时候聊着聊着真的没话说了,这时候你就用“说到这个,我想起……”这个句式,把话题转到另一个方向。 比如聊工作聊不下去了,你就说:“说到工作,我想起最近看到一个很有意思的新闻。”聊天气聊不下去了,你就说:“说到天气,我想起上次去旅游的时候……” 这个方法能让你永远有话说。今天的训练是准备五个常见话题,每个话题都想好三个可以转移的方向,然后找机会实际用一用。 第六天,咱们练组合拳,把前面学的所有技巧串起来。用一段对话里,你要做到重复关键词、提问、回应情绪、延伸话题,必要时转移话题。 今天找一个人跟他聊至少十分钟,在这十分钟里把所有技巧都用上。聊完之后回想一下,哪个技巧用得最顺手,哪个还需要加强。 第七天,咱们做实战测试。今天你要主动找三个不太熟的人聊天,可以是同事,可以是邻居,可以是店员。每次聊天至少五分钟,目标是让对话自然流畅、不冷场。 聊完之后给自己打个分,看看能不能做到全程不尴尬,话题能不能自然延伸。如果还有卡壳的地方,就回到前面对应的那天再练一遍。 这套方法的核心,就是让你有话可说,而不是说得多漂亮。你每天花十分钟练习,一周之后你会发现,跟任何人聊天都不再是难事。 平时你可以多看一些访谈节目,注意主持人是怎么提问的,怎么接话的。每天睡前回想一下今天的对话,哪些地方可以用上这些技巧,坚持下去,聊天这件事真的会变成一种本能反应。

另一面

29,082 görüntüleme • 4 ay önce

试了一下 OpenAI 新出的 Codex App,有些亮点 跟 Skills 的适配还是有点问题,模型的主要问题就是慢 OpenAI 给 Pro 和 Plus 用户的 Codex 额度在未来两个月内全部翻倍了 👇看一下详细的能力介绍: Skills 可视化管理 有一个专门的 Skills 列表界面,预置了一些官方 skills,也可以扫描你已经安装的 skills。注意这里只能扫描 NPX 安装的,本地创建的(比如在 Claude Code 里创建的)扫不出来。 还支持 Skills Creator 创建的 skills,可以直接在 APP 里用它去创建新 skills。 ------ 定时任务功能,这个挺实用的。 可以让 AI 定期执行某些任务,比如每周给你一个解决问题的报告,定期去解决某个项目的 PR 问题,或者定期 review 代码。 对于需要持续维护的项目来说,这个功能还是挺有价值的。 ------ Codex APP 现在支持计划模式了。 因为它跟 Codex CLI 共享后端,所以现在 Codex CLI 也同步支持计划模式了。这意味着 AI 会先规划任务步骤,让你确认后再执行。 ------ 用量显示的样式做得挺好的。 进度条、余量、使用情况都很清楚,一眼就能看到你还有多少额度。 还有 code review 的快捷方式,可以快速调用你的 skills。MCP 的添加也支持。 ====== 实测:用 video-wrapper skill 跑了一遍 我测试主要是让它跑了一个我最近做的 skill,可以一键给视频添加视频包装,比如卡片、花字、人物条、章节标题这些。 这个 skill 挺复杂的,所以很适合用来测试。 ------ 第一次运行的问题 可以工作,但第一次它选了 PIL 这个方案,比较差。 核心问题是什么?它跟你没有交互。 我的 skill 里边写清楚了:要先问用户要哪套方案,再给出包装方案让用户确认,用户确认了再开始包装。 但在 Codex 这里,明显没有交互。它就直接跑,把所有决定都自己做了,跑完就完了。出错了也不管,直接用降级方案。 ------ 修复后的效果 我让它修复以后,它倒是能修复。重新跑了一遍,效果也不错。 最终生成的视频包装效果还行: ▸ 左下角有人物卡片 ▸ 有花字 ▸ 有各种卡片和章节标题 ▸ 结论卡片也加上了 因为我们用前端代码约束了样式,所以它在样式上不会出什么错误。 ------ 体验总结 整个过程很不可控: ▸ 速度很慢 - Codex 本身速度就慢 ▸ 交互明显不够 - 你根本不知道进到哪个阶段了,也不知道它的方案是什么 ▸ 只管执行 - AI 一直在执行,不会停下来问你 可能是它不太适应 skills 规范,只是简单做了一下适配,没有 Claude Code 跟 skills 的适配那么好。

歸藏(guizang.ai)

30,595 görüntüleme • 6 ay önce