Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

字节跳动发布 原生音视频全双工模型 SeedRealtime 对标 GPT Live,跟豆包可以进行实时语音视频聊天 你举着手机开着摄像头跟它说话,它能一边看你眼前的东西、一边听你讲、一边开口回应,三件事同时干。 四人聚餐场景:用户逐一介绍在场的人,模型把名字和人对上,之后在七嘴八舌的讨论里始终分得清谁是谁。

148,148 Aufrufe • vor 7 Tagen •via X (Twitter)

0 Kommentare

Keine Kommentare verfügbar

Kommentare vom Original-Post werden hier angezeigt

Ähnliche Videos

NVIDIA 发布了类似豆包语音聊天的大模型 NVIDIA 放出了 PersonaPlex-7B-V1, 一个 7B 参数的全双工实时语音对话模型, 你可以理解为开源版的豆包语音聊天! 这玩意儿最牛的地方在于: 真正的全双工, 也就是说它能一边说一边听. 你打断它? 没问题, 它能立刻停下来听你说. 你俩同时说话? 也能处理. 这就是为啥叫 "Full Duplex" (全双工), 跟打电话一样自然. 技术上怎么实现的? 采用双流配置架构, 监听流和说话流同时运行. 模型基于 Moshi 架构魔改, 用 Mimi 编码器把语音压缩成神经编解码器 Token, 然后 7B 的 Transformer 同时预测文本和音频 Token, 最后 Mimi 解码器输出语音. 整个过程是流式的, 延迟极低. 还有个骚操作: 双重提示条件化. 你可以给它一段声音样本当 "声音提示", 它就能模仿那个声音风格说话; 再给个文本提示定义角色人设, 比如 "你是一个耐心的客服", 它就按这个人设来对话. 声音 + 人设, 都能定制. 跑分成绩: 在 FullDuplexBench 基准测试上, 平滑轮换成功率 90.8%, 用户打断处理成功率高达 95%, 响应延迟只有 170ms, 打断延迟 240ms. 官方说在对话动态、延迟、任务一致性上都优于其他开源和商业系统. 限制嘛: 目前只支持英语, 推荐硬件是 A100 80GB 或 H100, 不是一般人能跑得起的. 看了下训练数据用的是 Fisher English 数据集, 不到 1 万小时. 好消息是采用 NVIDIA Open Model License, 商用可用! 模型地址:

karminski-牙医

25,426 Aufrufe • vor 6 Monaten

说实话,这个数字人项目被严重低估了。 外面还在20美元/月买 HeyGen数字人会员,美团已经把整套数字人口播方案开源出来了。叫 InfiniteTalk,一张图一段话,口型、头、身体全同步,不限时长。老王拿照片试了一下,完全可用。 它表面是个数字人对口型工具,实际干的事比这多得多。底层用Wan视频模型负责出画面,再挂个音频分析引擎,把你说的每句话拆成嘴型、表情、身体该怎么动的指令,最后靠一种只刷新关键帧的策略,保人脸不崩背景不乱。 整条视频从上到下跟着音频走,不光嘴在动,肩膀、眉毛、眼神全跟着语音节奏变。那种只给你换张嘴的方案。 有两种用法。 1、拍张照片配段话扔进去,出来就是一条完整的说话视频,单人口播、唱歌都行。 2、塞段现成视频加段新音频进去,它能给原视频换配音,人物嘴型和身体动作全跟着新音频重新对齐。 硬件要求,英伟达cuda,显存至少24G,mac无法使用,内存32G以上,硬盘200G以上(权重就100G以上) 安装方法,不复杂, 让AI帮你建个新 Python 环境,跑一遍依赖清单,从 HuggingFace 拽三个模型包就齐了。从下载到出第一条视频,半小时够了。 PS:仓库在 GitHub,而且是Apache-2.0 协议,商用很友好。效果看这个视频,开源的东西做到这个程度,以前真不敢想。

产品经理老王霸

88,089 Aufrufe • vor 1 Monat

OpenAI 今天发布 GPT-Live,用全双工架构(full-duplex)取代 ChatGPT 原有的语音模式。同声传译的演示效果很惊艳。 两个型号 GPT-Live-1 和 GPT-Live-1 mini,分别面向付费和免费用户,今天起在 iOS、Android 和网页端全球推出。 这是 ChatGPT 语音的第三代技术。之前的语音模式本质上是"对讲机"模式,你说完它才说,中间稍微停顿一下就可能被打断。GPT-Live 改成了全双工,可以一边听你说一边自己说,每秒做多次交互决策,判断该说话、该闭嘴、该打断还是该调用工具。对话中它会像真人一样插入"mhmm""got it"之类的回应,表示在听。 架构上有一个比较有意思的变化:GPT-Live 把语音交互层和推理层拆开了。日常对话它自己处理,遇到需要联网搜索、深度推理的问题,就后台交给 GPT-5.5 去干活,自己继续跟你聊着。等结果出来了再无缝带回对话。OpenAI 说以后出了更新的模型会持续替换后端,前端语音模型不用重新训练。这个设计对做语音智能体的开发者可能比较有吸引力,也给了 OpenAI 一个把语音产品和模型迭代解耦的机制。 用户端还加了三档推理强度可选:Instant(快速回答)、Medium 和 High(需要想一会儿的复杂问题),九个语音角色也重新录制过。语音对话中还能显示天气、股票、体育比分等可视化卡片。 不过上线第一天用户反馈就出现了一个有点讽刺的问题:那些设计来让对话更自然的回应词,实际用起来让不少人觉得烦。社交媒体上已经有用户吐槽 GPT-Live 的"mhmm"太频繁,声音直接闯入注意力的感受和文字不同,AI 的热情过了头反而成了干扰。TechCrunch 在报道中也提到,演示中展示印地语实时翻译时,模型带着明显的美式口音,措辞偏书面,效果并不理想。OpenAI 说"针对最常用语言做了优化",但没有公布具体支持哪些语言。 另外,GPT-Live 上线时不支持视频通话和屏幕共享,需要这些功能的用户得切回旧版。API 也还没开放,开发者只能先登记排队。 每周有超过 1.5 亿人使用 ChatGPT 的语音和听写功能。OpenAI 显然把语音视为下一个主力交互界面,ChatGPT Voice 产品负责人 Atty Eleti 说自己散步时经常跟它聊三四十分钟。至于全双工到底是一次真正的体验升级,还是又一个演示很惊艳、日常用起来还得调的产品,可能还得看接下来几周用户怎么说。 官方介绍:

宝玉

79,384 Aufrufe • vor 1 Monat