Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

字节跳动发布 原生音视频全双工模型 SeedRealtime 对标 GPT Live,跟豆包可以进行实时语音视频聊天 你举着手机开着摄像头跟它说话,它能一边看你眼前的东西、一边听你讲、一边开口回应,三件事同时干。 四人聚餐场景:用户逐一介绍在场的人,模型把名字和人对上,之后在七嘴八舌的讨论里始终分得清谁是谁。

150,482 Aufrufe • vor 2 Monaten •via X (Twitter)

25 Kommentare

Profilbild von 小互
小互vor 2 Monaten

今天就在豆包 App 全量上线,免费,更新到最新版点「打电话」就能用,不用申请内测。 详细内容:

Profilbild von 恒星sun
恒星sunvor 2 Monaten

聚餐局还能不串名字,豆包这记性比我强哈哈哈

Profilbild von Nobody
Nobodyvor 2 Monaten

豆包+宇数 你就说有没有搞头?

Profilbild von Chasen
Chasenvor 2 Monaten

全双工就很厉害了,一边输入可以一边输出

Profilbild von 泰多宝
泰多宝vor 2 Monaten

黄仁勋:「AI正在走向所有地方、做所有事情,而且同时发生。」

Profilbild von Yixin
Yixinvor 2 Monaten

豆包的全双工不是至少年初就有了吗

Profilbild von Keye | 科爷的数字生命
Keye | 科爷的数字生命vor 2 Monaten

从此咱家多一口人……是多一张口,还不用加一双筷子,就是太爱插嘴。

Profilbild von Test666
Test666vor 2 Monaten

有点意思,没想到出的还挺快的,估计会有很多抖音用户分享吧

Profilbild von 赛博老登
赛博老登vor 2 Monaten

豆包的语音我试了下还挺不错,中间打断他还能跟上,跟正常人聊天水平差不多。

Profilbild von 风雪漫千山
风雪漫千山vor 2 Monaten

让Agent先长出眼睛耳朵

Profilbild von DoRaGon
DoRaGonvor 2 Monaten

早就能全双工了,可以去b站看看,大概年初

Profilbild von Wei佳
Wei佳vor 2 Monaten

和之前对话感觉进步不大吧

Profilbild von 夏目在日本·
夏目在日本·vor 2 Monaten

還能這麽玩

Profilbild von EBS
EBSvor 2 Monaten

重点是兜住

Profilbild von Calvin Zheng
Calvin Zhengvor 2 Monaten

说话不行啊,还是机器人啊,gpt那个说话很像真人了

Profilbild von Zhou Rongxuan
Zhou Rongxuanvor 2 Monaten

豆包现在的 seed 2.1 turbo 怎么样?聪明吗?能用来处理工作吗?

Profilbild von book or technique
book or techniquevor 2 Monaten

So it watches, listens, and talks back? My group dinner just got an NPC. Still creepy. Still kinda magic.

Profilbild von RF北灰
RF北灰vor 2 Monaten

豆包老早就有这个视频功能了,之前还让豆包帮看穿搭,帮读书,多人倒是没试过,现在应该只是放出来不是都搬砖有了?

Profilbild von 解意 JIE YI
解意 JIE YIvor 2 Monaten

这个分人能力太实用了,聚餐场景简直刚需

Profilbild von 雪瑜
雪瑜vor 2 Monaten

这RAG记忆系统已经发展到这个地步了 感觉把历史记忆数据和现实结合起来了 这么看具身机器人还真有搞头👍

Profilbild von Gulzar Junaid
Gulzar Junaidvor 2 Monaten

Am loosing my senses now! The speed at all these tech flowing in! Rather crashing in! Gosh!

Profilbild von 左海
左海vor 2 Monaten

这就强的可怕,官方有说是否开源么? 这可使用的业务场景太多了,比如修飞机。

Profilbild von 来自东方的辣条
来自东方的辣条vor 2 Monaten

这不是早就有了吗,我还用过跟豆包实时语音。体验很好的,豆包会接住你每一句话

Profilbild von Irisy 艾瑞丝
Irisy 艾瑞丝vor 2 Monaten

重要的不是它能视频和语音聊天,重要的是,它的回复像不像真人

Profilbild von 清风徐来028
清风徐来028vor 2 Monaten

这不就是人见人爱的 gpt4o 么

Ähnliche Videos

ChatGPT 桌面端(原来的 Codex App)今天加入了语音控制,macOS 和 Windows 用户可以直接用嘴指挥 AI 干活了。 具体来说,你可以一边跟 ChatGPT 说话,一边让它操控电脑、启动 Codex 写代码、调度 ChatGPT Work 执行任务,全程不用打字。开着一个语音对话,同时管理多个后台 Agent(智能体),有点像一个人坐在那里口述指令,几个助手分头干活。 这个功能基于 GPT-Live,OpenAI 在 7 月 8 日刚上线的新一代语音模型。GPT-Live 最大的变化是全双工架构,也就是它能同时听你说话和给你回话,不用像以前那样等你说完、停顿、它再开口。遇到复杂问题,它会把推理任务丢给后台的 GPT-5.5 处理,自己继续跟你聊,不会卡住。 macOS 用户多了一个叫 Appshots 的功能:语音对话时,ChatGPT 可以直接看到你当前最前面的窗口,了解你在做什么,回答就更贴合上下文。比如你正在看一段代码,直接说“这个函数有什么问题”,它能看到屏幕内容来回答。Windows 用户暂时没有这个能力。 此外,iPhone 用户可以通过远程配对的方式,用 iOS 上的 ChatGPT 语音来操控桌面端的 Codex。等于你拿着手机在沙发上就能指挥电脑写代码。Android 支持还在路上。 今天全球同步推出,面向 Plus、Pro、Business、Edu 和 Enterprise 用户。免费用户暂不可用。

宝玉

89,993 Aufrufe • vor 2 Monaten

NVIDIA 发布了类似豆包语音聊天的大模型 NVIDIA 放出了 PersonaPlex-7B-V1, 一个 7B 参数的全双工实时语音对话模型, 你可以理解为开源版的豆包语音聊天! 这玩意儿最牛的地方在于: 真正的全双工, 也就是说它能一边说一边听. 你打断它? 没问题, 它能立刻停下来听你说. 你俩同时说话? 也能处理. 这就是为啥叫 "Full Duplex" (全双工), 跟打电话一样自然. 技术上怎么实现的? 采用双流配置架构, 监听流和说话流同时运行. 模型基于 Moshi 架构魔改, 用 Mimi 编码器把语音压缩成神经编解码器 Token, 然后 7B 的 Transformer 同时预测文本和音频 Token, 最后 Mimi 解码器输出语音. 整个过程是流式的, 延迟极低. 还有个骚操作: 双重提示条件化. 你可以给它一段声音样本当 "声音提示", 它就能模仿那个声音风格说话; 再给个文本提示定义角色人设, 比如 "你是一个耐心的客服", 它就按这个人设来对话. 声音 + 人设, 都能定制. 跑分成绩: 在 FullDuplexBench 基准测试上, 平滑轮换成功率 90.8%, 用户打断处理成功率高达 95%, 响应延迟只有 170ms, 打断延迟 240ms. 官方说在对话动态、延迟、任务一致性上都优于其他开源和商业系统. 限制嘛: 目前只支持英语, 推荐硬件是 A100 80GB 或 H100, 不是一般人能跑得起的. 看了下训练数据用的是 Fisher English 数据集, 不到 1 万小时. 好消息是采用 NVIDIA Open Model License, 商用可用! 模型地址:

karminski-牙医

25,426 Aufrufe • vor 8 Monaten

说实话,这个数字人项目被严重低估了。 外面还在20美元/月买 HeyGen数字人会员,美团已经把整套数字人口播方案开源出来了。叫 InfiniteTalk,一张图一段话,口型、头、身体全同步,不限时长。老王拿照片试了一下,完全可用。 它表面是个数字人对口型工具,实际干的事比这多得多。底层用Wan视频模型负责出画面,再挂个音频分析引擎,把你说的每句话拆成嘴型、表情、身体该怎么动的指令,最后靠一种只刷新关键帧的策略,保人脸不崩背景不乱。 整条视频从上到下跟着音频走,不光嘴在动,肩膀、眉毛、眼神全跟着语音节奏变。那种只给你换张嘴的方案。 有两种用法。 1、拍张照片配段话扔进去,出来就是一条完整的说话视频,单人口播、唱歌都行。 2、塞段现成视频加段新音频进去,它能给原视频换配音,人物嘴型和身体动作全跟着新音频重新对齐。 硬件要求,英伟达cuda,显存至少24G,mac无法使用,内存32G以上,硬盘200G以上(权重就100G以上) 安装方法,不复杂, 让AI帮你建个新 Python 环境,跑一遍依赖清单,从 HuggingFace 拽三个模型包就齐了。从下载到出第一条视频,半小时够了。 PS:仓库在 GitHub,而且是Apache-2.0 协议,商用很友好。效果看这个视频,开源的东西做到这个程度,以前真不敢想。

产品经理老王霸

90,306 Aufrufe • vor 3 Monaten

OpenAI 今天发布 GPT-Live,用全双工架构(full-duplex)取代 ChatGPT 原有的语音模式。同声传译的演示效果很惊艳。 两个型号 GPT-Live-1 和 GPT-Live-1 mini,分别面向付费和免费用户,今天起在 iOS、Android 和网页端全球推出。 这是 ChatGPT 语音的第三代技术。之前的语音模式本质上是"对讲机"模式,你说完它才说,中间稍微停顿一下就可能被打断。GPT-Live 改成了全双工,可以一边听你说一边自己说,每秒做多次交互决策,判断该说话、该闭嘴、该打断还是该调用工具。对话中它会像真人一样插入"mhmm""got it"之类的回应,表示在听。 架构上有一个比较有意思的变化:GPT-Live 把语音交互层和推理层拆开了。日常对话它自己处理,遇到需要联网搜索、深度推理的问题,就后台交给 GPT-5.5 去干活,自己继续跟你聊着。等结果出来了再无缝带回对话。OpenAI 说以后出了更新的模型会持续替换后端,前端语音模型不用重新训练。这个设计对做语音智能体的开发者可能比较有吸引力,也给了 OpenAI 一个把语音产品和模型迭代解耦的机制。 用户端还加了三档推理强度可选:Instant(快速回答)、Medium 和 High(需要想一会儿的复杂问题),九个语音角色也重新录制过。语音对话中还能显示天气、股票、体育比分等可视化卡片。 不过上线第一天用户反馈就出现了一个有点讽刺的问题:那些设计来让对话更自然的回应词,实际用起来让不少人觉得烦。社交媒体上已经有用户吐槽 GPT-Live 的"mhmm"太频繁,声音直接闯入注意力的感受和文字不同,AI 的热情过了头反而成了干扰。TechCrunch 在报道中也提到,演示中展示印地语实时翻译时,模型带着明显的美式口音,措辞偏书面,效果并不理想。OpenAI 说"针对最常用语言做了优化",但没有公布具体支持哪些语言。 另外,GPT-Live 上线时不支持视频通话和屏幕共享,需要这些功能的用户得切回旧版。API 也还没开放,开发者只能先登记排队。 每周有超过 1.5 亿人使用 ChatGPT 的语音和听写功能。OpenAI 显然把语音视为下一个主力交互界面,ChatGPT Voice 产品负责人 Atty Eleti 说自己散步时经常跟它聊三四十分钟。至于全双工到底是一次真正的体验升级,还是又一个演示很惊艳、日常用起来还得调的产品,可能还得看接下来几周用户怎么说。 官方介绍:

宝玉

81,070 Aufrufe • vor 3 Monaten

女朋友一生气就切方言,男朋友一句都没听懂,字幕全听懂了。 四川话、粤语、英语、法语,11 句台词,AI 字幕一个字没改,11 句全对。 短片是我做的,字幕交给一个开源语音模型,它输出什么我就往视频里贴什么。右上角挂着"未人工修改",连男生结巴的那句"你你说啥"都原样留着。 同一段音频我喂给了 Whisper large-v3 做对照,差距比我预想的大: 粤语那句"你话过请我食饭㗎,唔好赖账",Whisper 写成"你曾說過請我吃飯的,不要賴帳",翻成书面中文了,粤语原文一个字不剩;这个模型写的是"你话过请我食饭噶唔好赖帐",唔、噶、话过全在,广东人一看就是原话。 四川话的"莫"和"要得",Whisper 写成"别"和"要的";它原样保留。 英语那句 "Seriously? You forgot again?",Whisper 整句漏掉,它一字不差。 这个模型叫 Hojo-ASR-Multi-V1。它改掉的规则只有一条:不翻译你说的话,你说什么字,它就写什么字。 视频之外我还单独跑了两轮数据。上一期 90 条欧洲五语种真人音频,干净音频它比 Whisper 略输一点,加噪和 1.4 倍速后反超,90 条里零语言误判、零幻觉,Whisper 则把一句意大利语认成了瑞典语。这期 30 条中文系加英语:普通话、英语双方全对;粤语按字算,它错 7%,Whisper 错 50%,错的全是"翻译"造成的;四川话它错 3%,Whisper 错 11%。 更有意思的是,模型页面到今天还写着"中文、英文待支持"。Credits 里鸣谢了 WenetSpeech-Chuan 和 WenetSpeech-Yue 两个川渝、粤语数据集,能力其实早就训进去了,只是文档没跟上。 想自己上手:pip install hojo-asr,权重 12GB 从 Hugging Face 拉,Mac 上 CPU 跑 float32 就行,峰值内存 20GB。前面接一个 VAD 按停顿切句再送进去,这是这类大模型底座语音模型的标准用法,逐句识别时语言切换更稳。输出是全小写无标点,做字幕直接用,要标点的场景自己补一步。 不适合谁:16GB 内存的机器别试;中文长音频我还没测过,这次只测了短句和这条短片。 Apache 2.0,商用也行。他们的官方账号是 HojoAI,roadmap 上写着推理引擎和小型化,什么时候能塞进耳机我会一直盯着,想跟进的可以关注一下。

雨哥向前冲

529,723 Aufrufe • vor 17 Tagen