Video wird geladen...
Video konnte nicht geladen werden
昨天豆包的视频通话功能升级了,感觉比 GPT Live 还强! 可以看我录屏,真的超预期。 测试让豆包陪我一起看一个Youtube视频,画面出现个人,直接问这人是谁,竟然答对了! 画面有个一闪而过的图表,问:“刚才有个图表,你能给我解读下吗?”。 它竟然知道我指的是哪个图,并完整解释。 对话延迟低,语音自然,也没有GPT Live的老外腔(国产模型天然优势),很像真人对话。 未来场景相当多啊!K12教育、导览、机器人、实时翻译总结等。 Seed官方公众号说这个技术叫:原生音视频全双工大模型 SeedRealtime。 豆包 App 已全量上线,更新到最新版,点"打电话"图标,开摄像头就能用,不用申请内测。 下面技术解读和另一个测试。
33,877 Aufrufe • vor 1 Monat •via X (Twitter)
23 Kommentare

SeedRealtime,一个能看懂画面、理解手势、识别物品的全模态全双工交互模型。 现有主流音视频实时交互,要么是多模块级联(ASR 转文字、VLM 理解画面、TTS 合成语音),延迟层层叠加,信息逐级损耗。要么号称端到端,但轮次判断仍然依赖外置 VAD 模块,本质上还是一问一答的半双工逻辑。 用户说话的时候,模型在等。模型说话的时候,用户也在等。 SeedRealtime 将声音、画面、时序与表达纳入到同一个模型实时决策,听、看、理解、推理、说话全在一个模型里。在连续音视频流上,感知、理解、决策与表达同步进行,使听到的和看到的能够参与每次的实时判断。 比如当用户说"这个怎么弄","这个"是什么?在纯语音系统,问题无解。 在 SeedRealtime 里,模型会结合当前画面、用户的手势、视线方向和历史操作,判断"这个"的具体指向。 当遇到同音词或语音模糊时,也能借助视觉场景消除歧义。 这里可以看我的实测,手指着天龙功放按键,模型理解回答,很自然。 据说 OpenAI GPT Live 也只是音频全双工,SeedRealtime 则是全模态(视频、音频、文本)全双工,强啊!

真的啊,确实很强,超预期

这个和谷歌的有什么不一样吗?

需要是会员吗?

不需要,免费会员就能用

要一直举着手机吗

我都打算给备用手机弄个支架随时对话聊了

现在画面的理解应该还是基于截图的吧?它是怎么能转那么快的

加入到AI眼镜上绝对是王炸

SeedRealtime 可以成为小智机器人的外挂存在。哈哈 真正的Her——萨曼莎。

现在GPT用不了视频模式呀

Gemini早就有了,不过对话不是全双工的。

Gemini也很不错,全模态全双工还是比较少见。

哥 你能看到我吗

感觉还是离人的感觉差很多,尤其是在插话的时候

其实我感觉升级前也强

陪看YouTube还能认人,豆包未来可期啊

我也测试了,发现能力强很多,但对比gdt,似乎还需要继续努力。

gdt是全模态吗?

豆包这波操作有点东西啊!

这是实时把自己放网上直播?并把自己实时录像传给豆包数据库?

其实这个功能还有个合适的是去景点,每个景点的典故都能介绍一遍,在去年没有这么强大的时候就已经好用了🤫

每次和 AI 聊天聊多了之后,就会觉得 AI 真的很有耐心,这真的是一个挺危险的东西
