Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

昨天豆包的视频通话功能升级了,感觉比 GPT Live 还强! 可以看我录屏,真的超预期。 测试让豆包陪我一起看一个Youtube视频,画面出现个人,直接问这人是谁,竟然答对了! 画面有个一闪而过的图表,问:“刚才有个图表,你能给我解读下吗?”。 它竟然知道我指的是哪个图,并完整解释。 对话延迟低,语音自然,也没有GPT Live的老外腔(国产模型天然优势),很像真人对话。 未来场景相当多啊!K12教育、导览、机器人、实时翻译总结等。 Seed官方公众号说这个技术叫:原生音视频全双工大模型 SeedRealtime。 豆包 App 已全量上线,更新到最新版,点"打电话"图标,开摄像头就能用,不用申请内测。 下面技术解读和另一个测试。

33,877 Aufrufe • vor 1 Monat •via X (Twitter)

23 Kommentare

Profilbild von 向阳乔木
向阳乔木vor 1 Monat

SeedRealtime,一个能看懂画面、理解手势、识别物品的全模态全双工交互模型。 现有主流音视频实时交互,要么是多模块级联(ASR 转文字、VLM 理解画面、TTS 合成语音),延迟层层叠加,信息逐级损耗。要么号称端到端,但轮次判断仍然依赖外置 VAD 模块,本质上还是一问一答的半双工逻辑。 用户说话的时候,模型在等。模型说话的时候,用户也在等。 SeedRealtime 将声音、画面、时序与表达纳入到同一个模型实时决策,听、看、理解、推理、说话全在一个模型里。在连续音视频流上,感知、理解、决策与表达同步进行,使听到的和看到的能够参与每次的实时判断。 比如当用户说"这个怎么弄","这个"是什么?在纯语音系统,问题无解。 在 SeedRealtime 里,模型会结合当前画面、用户的手势、视线方向和历史操作,判断"这个"的具体指向。 当遇到同音词或语音模糊时,也能借助视觉场景消除歧义。 这里可以看我的实测,手指着天龙功放按键,模型理解回答,很自然。 据说 OpenAI GPT Live 也只是音频全双工,SeedRealtime 则是全模态(视频、音频、文本)全双工,强啊!

Profilbild von 道格
道格vor 1 Monat

真的啊,确实很强,超预期

Profilbild von Super Grok Heavily
Super Grok Heavilyvor 1 Monat

这个和谷歌的有什么不一样吗?

Profilbild von Melman Miller
Melman Millervor 1 Monat

需要是会员吗?

Profilbild von 向阳乔木
向阳乔木vor 1 Monat

不需要,免费会员就能用

Profilbild von Tian
Tianvor 1 Monat

要一直举着手机吗

Profilbild von 向阳乔木
向阳乔木vor 1 Monat

我都打算给备用手机弄个支架随时对话聊了

Profilbild von Niko爱学习
Niko爱学习vor 1 Monat

现在画面的理解应该还是基于截图的吧?它是怎么能转那么快的

Profilbild von 思维之熵
思维之熵vor 1 Monat

加入到AI眼镜上绝对是王炸

Profilbild von 紫苏子ACG
紫苏子ACGvor 1 Monat

SeedRealtime 可以成为小智机器人的外挂存在。哈哈 真正的Her——萨曼莎。

Profilbild von SamsungCN
SamsungCNvor 1 Monat

现在GPT用不了视频模式呀

Profilbild von HelloWorld
HelloWorldvor 1 Monat

Gemini早就有了,不过对话不是全双工的。

Profilbild von 向阳乔木
向阳乔木vor 1 Monat

Gemini也很不错,全模态全双工还是比较少见。

Profilbild von ranran
ranranvor 1 Monat

哥 你能看到我吗

Profilbild von happyOne
happyOnevor 1 Monat

感觉还是离人的感觉差很多,尤其是在插话的时候

Profilbild von Wei佳
Wei佳vor 1 Monat

其实我感觉升级前也强

Profilbild von foxboy🦊
foxboy🦊vor 1 Monat

陪看YouTube还能认人,豆包未来可期啊

Profilbild von owen欧文
owen欧文vor 1 Monat

我也测试了,发现能力强很多,但对比gdt,似乎还需要继续努力。

Profilbild von 向阳乔木
向阳乔木vor 1 Monat

gdt是全模态吗?

Profilbild von 阿台🕊️
阿台🕊️vor 1 Monat

豆包这波操作有点东西啊!

Profilbild von btc
btcvor 1 Monat

这是实时把自己放网上直播?并把自己实时录像传给豆包数据库?

Profilbild von Stefan Wan
Stefan Wanvor 1 Monat

其实这个功能还有个合适的是去景点,每个景点的典故都能介绍一遍,在去年没有这么强大的时候就已经好用了🤫

Profilbild von Chasen
Chasenvor 1 Monat

每次和 AI 聊天聊多了之后,就会觉得 AI 真的很有耐心,这真的是一个挺危险的东西

Ähnliche Videos

NVIDIA 发布了类似豆包语音聊天的大模型 NVIDIA 放出了 PersonaPlex-7B-V1, 一个 7B 参数的全双工实时语音对话模型, 你可以理解为开源版的豆包语音聊天! 这玩意儿最牛的地方在于: 真正的全双工, 也就是说它能一边说一边听. 你打断它? 没问题, 它能立刻停下来听你说. 你俩同时说话? 也能处理. 这就是为啥叫 "Full Duplex" (全双工), 跟打电话一样自然. 技术上怎么实现的? 采用双流配置架构, 监听流和说话流同时运行. 模型基于 Moshi 架构魔改, 用 Mimi 编码器把语音压缩成神经编解码器 Token, 然后 7B 的 Transformer 同时预测文本和音频 Token, 最后 Mimi 解码器输出语音. 整个过程是流式的, 延迟极低. 还有个骚操作: 双重提示条件化. 你可以给它一段声音样本当 "声音提示", 它就能模仿那个声音风格说话; 再给个文本提示定义角色人设, 比如 "你是一个耐心的客服", 它就按这个人设来对话. 声音 + 人设, 都能定制. 跑分成绩: 在 FullDuplexBench 基准测试上, 平滑轮换成功率 90.8%, 用户打断处理成功率高达 95%, 响应延迟只有 170ms, 打断延迟 240ms. 官方说在对话动态、延迟、任务一致性上都优于其他开源和商业系统. 限制嘛: 目前只支持英语, 推荐硬件是 A100 80GB 或 H100, 不是一般人能跑得起的. 看了下训练数据用的是 Fisher English 数据集, 不到 1 万小时. 好消息是采用 NVIDIA Open Model License, 商用可用! 模型地址:

karminski-牙医

25,426 Aufrufe • vor 8 Monaten