正在加载视频...

视频加载失败

阿里最新开源了一个实时语音Harness:Qwen-Audio-Agent,让你的Agent能像打电话一样对话,你边说边想,它边听边干活 简单说就是它给你的OpenCode、OpenClaw、Codex们加上了耳朵和嘴巴,然后你就可以用打电话的方式跟这些AI协作 OpenAI有GPT-Live,Qwen-Audio-Agent等于是给现有的Agent生态提供了一个统一的实时语音前台入口 前台上,全双工实时语音层,支持连续对话和自然打断 后台上,对接OpenCode、OpenClaw、Qoder、Hermes、CodeBuddy、Codex各类Agent,负责搜索、推理、写代码、改文件等深度任务 复杂任务委派给后台Agent,执行结果实时带回当前语音对话 人机协作方式就变成了:你一边说Agent一边干,你可以随时插嘴补充,它边干活边给你汇报进展,对话过程跟打电话一样 #AI语音 #agent语音助手 #qwenaudio

69,606 次观看 • 2 个月前 •via X (Twitter)

17 条评论

AIGCLINK 的头像
AIGCLINK2 个月前

github:

ナズキキ 的头像
ナズキキ2 个月前

越活越像那个天杀的一直逼逼叨叨的产品经理了

Esyion 的头像
Esyion2 个月前

Gpt的实时语音才是神,各种情绪,停顿。其他模型啥也不是。语音模型只有gpt和其他

斌斌有礼 的头像
斌斌有礼2 个月前

部署要什么配置

晚晚 的头像
晚晚2 个月前

以后催它改代码更像打电话摇人了

Rivers 的头像
Rivers2 个月前

语音成为了大厂竞争的又一个战场

Chasen 的头像
Chasen2 个月前

把语音作为 Agent 的前台交互入口确实大大提升了打字不便场景下的协作体验

风中浪客 的头像
风中浪客2 个月前

卧槽这个可以,以后跟agent打电话调bug,省得我打字了

rikarufort 的头像
rikarufort2 个月前

抄袭速度世界第一 啥时候能创新速度第一

Crio Songo 的头像
Crio Songo2 个月前

这个思路挺实用的,现在很多Agent都没有好用的实时语音入口,这个统一接入的方案把前后端分工理清楚了,还支持自然打断,相当于给AI Agent补上了实时语音交互的短板,回头可以找源码试试看效果。

FlowOps Daily 的头像
FlowOps Daily2 个月前

“给 Codex 们加上耳朵和嘴巴”这个说法很形象,但真落地时最先出事的往往不是语音,而是权限边界。能听会说只是入口,哪些命令能直跑、哪些资料能外发,最好一开始就拆开。

Swain Sun 的头像
Swain Sun2 个月前

这个可以

John 的头像
John2 个月前

接API的吧,不要隐私的可以用

光头狗头 的头像
光头狗头2 个月前

这个方向可以

阿台🕊️ 的头像
阿台🕊️2 个月前

这声音也太会了吧!

awanputih 𓂀 的头像
awanputih 𓂀2 个月前

that is actually dope. adding real time voice to agents changes the whole workflow. it is no longer just text loops but actual fluid conversation. the real ones know this is the next big leap for local automation

Andsy chun 的头像
Andsy chun2 个月前

你这么厉害了.

相关视频

ChatGPT 桌面端(原来的 Codex App)今天加入了语音控制,macOS 和 Windows 用户可以直接用嘴指挥 AI 干活了。 具体来说,你可以一边跟 ChatGPT 说话,一边让它操控电脑、启动 Codex 写代码、调度 ChatGPT Work 执行任务,全程不用打字。开着一个语音对话,同时管理多个后台 Agent(智能体),有点像一个人坐在那里口述指令,几个助手分头干活。 这个功能基于 GPT-Live,OpenAI 在 7 月 8 日刚上线的新一代语音模型。GPT-Live 最大的变化是全双工架构,也就是它能同时听你说话和给你回话,不用像以前那样等你说完、停顿、它再开口。遇到复杂问题,它会把推理任务丢给后台的 GPT-5.5 处理,自己继续跟你聊,不会卡住。 macOS 用户多了一个叫 Appshots 的功能:语音对话时,ChatGPT 可以直接看到你当前最前面的窗口,了解你在做什么,回答就更贴合上下文。比如你正在看一段代码,直接说“这个函数有什么问题”,它能看到屏幕内容来回答。Windows 用户暂时没有这个能力。 此外,iPhone 用户可以通过远程配对的方式,用 iOS 上的 ChatGPT 语音来操控桌面端的 Codex。等于你拿着手机在沙发上就能指挥电脑写代码。Android 支持还在路上。 今天全球同步推出,面向 Plus、Pro、Business、Edu 和 Enterprise 用户。免费用户暂不可用。

宝玉

89,993 次观看 • 2 个月前

NVIDIA 发布了类似豆包语音聊天的大模型 NVIDIA 放出了 PersonaPlex-7B-V1, 一个 7B 参数的全双工实时语音对话模型, 你可以理解为开源版的豆包语音聊天! 这玩意儿最牛的地方在于: 真正的全双工, 也就是说它能一边说一边听. 你打断它? 没问题, 它能立刻停下来听你说. 你俩同时说话? 也能处理. 这就是为啥叫 "Full Duplex" (全双工), 跟打电话一样自然. 技术上怎么实现的? 采用双流配置架构, 监听流和说话流同时运行. 模型基于 Moshi 架构魔改, 用 Mimi 编码器把语音压缩成神经编解码器 Token, 然后 7B 的 Transformer 同时预测文本和音频 Token, 最后 Mimi 解码器输出语音. 整个过程是流式的, 延迟极低. 还有个骚操作: 双重提示条件化. 你可以给它一段声音样本当 "声音提示", 它就能模仿那个声音风格说话; 再给个文本提示定义角色人设, 比如 "你是一个耐心的客服", 它就按这个人设来对话. 声音 + 人设, 都能定制. 跑分成绩: 在 FullDuplexBench 基准测试上, 平滑轮换成功率 90.8%, 用户打断处理成功率高达 95%, 响应延迟只有 170ms, 打断延迟 240ms. 官方说在对话动态、延迟、任务一致性上都优于其他开源和商业系统. 限制嘛: 目前只支持英语, 推荐硬件是 A100 80GB 或 H100, 不是一般人能跑得起的. 看了下训练数据用的是 Fisher English 数据集, 不到 1 万小时. 好消息是采用 NVIDIA Open Model License, 商用可用! 模型地址:

karminski-牙医

25,426 次观看 • 8 个月前

阿里刚刚一口气发了五款语音模型:Qwen-Audio-3.1系列,并全线降价,ASR降95%、Realtime降85%、TTS降70% 同时覆盖理解、生成、创作、实时交互的完整链条。阿里这次直接打出了语音模型的三板斧:能力全栈化、价格断崖下探、语音被推到Agent/硬件入口位置 它这次的Realtime不是只会聊天,是全双工可打断、能识别情绪、能多语言切换,还能调用工具,这就会把语音从搜索式问答推向事务式对话 实时语音从“功能”变成“交互入口”,直接冲击客服、助手以及硬件,AI眼镜、办公Agent、硬件结合等无屏化任务场景或将迎来一波热潮 ASR:能转写30种语言+16种中文方言、原生转写润色(去语气词/重复、语义重组)、分角色转写(谁在什么时候说了什么,带时间戳,支持插话/重叠语音)、流式低延迟(首字约160毫秒) ASR-Next:从“语音转文字”扩展到“理解整个音频”,能听出情绪、环境声、机械声,理解事件时间、进行音频问答 TTS:重点是同一音色跨语言/方言不变味,还能控制情绪和语速 TTS-Next:这个比较狠,从“配音”升级到“做完整音频作品”,一次生成人声、音效、环境音,多角色音色一致、全程不变声;48kHz输出 直接瞄准播客、有声书、影视、游戏、广告等场景 Realtime:全双工,可同时说和听,可打断、能共情、能无缝切换语言、对话中能调用Agent工具完成任务 #阿里语音模型 #QwenAudio

AIGCLINK

16,367 次观看 • 14 天前