Loading video...

Video Failed to Load

Go Home

GPT-Realtime-2 语音模型发布 语音首次接入 GPT-5 推理能力 OpenAI一口气发布了三个实时语音模型: GPT-Realtime-2 GPT-Realtime-Translate GPT-Realtime-Whisper 其中GPT-Realtime-2 是其中的主角,这是 OpenAI 第一次把“GPT-5 级推理”塞进语音模型,同时把上下文从 32K 扩到 128K... GPT-Realtime-2:首个具备 GPT-5 级推理能力的语音模型,能在对话中推理复杂请求、并行调工具、处理打断和纠错,上下文窗口从 32K 升到 128K GPT-Realtime-Translate:实时语音翻译模型,支持 70+ 种输入语言、13 种输出语言,跟着说话人的节奏边听边译,能处理口音和专业词 GPT-Realtime-Whisper:流式语音转文字模型,边说边出字,专门给实时字幕、会议纪要、客服转写这类不能等的

31,189 views • 2 months ago •via X (Twitter)

0 Comments

No comments available

Comments from the original post will appear here

Related Videos

OpenAI 今天发布 GPT-Live,用全双工架构(full-duplex)取代 ChatGPT 原有的语音模式。同声传译的演示效果很惊艳。 两个型号 GPT-Live-1 和 GPT-Live-1 mini,分别面向付费和免费用户,今天起在 iOS、Android 和网页端全球推出。 这是 ChatGPT 语音的第三代技术。之前的语音模式本质上是"对讲机"模式,你说完它才说,中间稍微停顿一下就可能被打断。GPT-Live 改成了全双工,可以一边听你说一边自己说,每秒做多次交互决策,判断该说话、该闭嘴、该打断还是该调用工具。对话中它会像真人一样插入"mhmm""got it"之类的回应,表示在听。 架构上有一个比较有意思的变化:GPT-Live 把语音交互层和推理层拆开了。日常对话它自己处理,遇到需要联网搜索、深度推理的问题,就后台交给 GPT-5.5 去干活,自己继续跟你聊着。等结果出来了再无缝带回对话。OpenAI 说以后出了更新的模型会持续替换后端,前端语音模型不用重新训练。这个设计对做语音智能体的开发者可能比较有吸引力,也给了 OpenAI 一个把语音产品和模型迭代解耦的机制。 用户端还加了三档推理强度可选:Instant(快速回答)、Medium 和 High(需要想一会儿的复杂问题),九个语音角色也重新录制过。语音对话中还能显示天气、股票、体育比分等可视化卡片。 不过上线第一天用户反馈就出现了一个有点讽刺的问题:那些设计来让对话更自然的回应词,实际用起来让不少人觉得烦。社交媒体上已经有用户吐槽 GPT-Live 的"mhmm"太频繁,声音直接闯入注意力的感受和文字不同,AI 的热情过了头反而成了干扰。TechCrunch 在报道中也提到,演示中展示印地语实时翻译时,模型带着明显的美式口音,措辞偏书面,效果并不理想。OpenAI 说"针对最常用语言做了优化",但没有公布具体支持哪些语言。 另外,GPT-Live 上线时不支持视频通话和屏幕共享,需要这些功能的用户得切回旧版。API 也还没开放,开发者只能先登记排队。 每周有超过 1.5 亿人使用 ChatGPT 的语音和听写功能。OpenAI 显然把语音视为下一个主力交互界面,ChatGPT Voice 产品负责人 Atty Eleti 说自己散步时经常跟它聊三四十分钟。至于全双工到底是一次真正的体验升级,还是又一个演示很惊艳、日常用起来还得调的产品,可能还得看接下来几周用户怎么说。 官方介绍:

宝玉

78,439 views • 18 days ago