Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

兄弟们,阿里今天直接放了个大招——Qwen3.5-Omni 正式上线了! 这玩意儿不是那种拼凑的多模态, 而是真正原生全模态,文本、图片、音频、视频一股脑儿全吃得下,还能实时吐出自然语音。 看一段手绘界面视频, 它居然能直接“看懂”你的需求, 瞬间生成能跑的代码和移动端效果——Audio-Visual Vibe Coding 能力自然涌现,简直像AI自己开窍了,太离谱! 它支持超长输入: 10小时音频或1小时视频, 上下文256K,还能生成带时间戳、 场景切换、说话人映射的细粒度视频脚本。 语义打断超自然,背景噪音也不怕, 74种语言识别+29种语言生成, 音色克隆、语音控制样样行。 内置WebSearch和复杂Function Call, 真正能自主干活的Agent感拉满。 阿里给了Plus、Flash、Light三个版本, 开发者直接在阿里云上玩,成本和效率都在线。 做视频剪辑、UI原型、跨语言交互的兄弟,这波直接起飞!谁试过了?快来分享你的神操作! #Qwen3.5Omni

10,388 Aufrufe • vor 6 Monaten •via X (Twitter)

2 Kommentare

Profilbild von jendy
jendyvor 6 Monaten

这个真的好用嘛。有同学试过没有。国产的感觉怎么就不可靠的样子。

Profilbild von HankAI
HankAIvor 6 Monaten

Qwen3.5-Omni-Plus-Realtime: Qwen3.5-Omni-Plus:

Ähnliche Videos

阿里刚刚一口气发了五款语音模型:Qwen-Audio-3.1系列,并全线降价,ASR降95%、Realtime降85%、TTS降70% 同时覆盖理解、生成、创作、实时交互的完整链条。阿里这次直接打出了语音模型的三板斧:能力全栈化、价格断崖下探、语音被推到Agent/硬件入口位置 它这次的Realtime不是只会聊天,是全双工可打断、能识别情绪、能多语言切换,还能调用工具,这就会把语音从搜索式问答推向事务式对话 实时语音从“功能”变成“交互入口”,直接冲击客服、助手以及硬件,AI眼镜、办公Agent、硬件结合等无屏化任务场景或将迎来一波热潮 ASR:能转写30种语言+16种中文方言、原生转写润色(去语气词/重复、语义重组)、分角色转写(谁在什么时候说了什么,带时间戳,支持插话/重叠语音)、流式低延迟(首字约160毫秒) ASR-Next:从“语音转文字”扩展到“理解整个音频”,能听出情绪、环境声、机械声,理解事件时间、进行音频问答 TTS:重点是同一音色跨语言/方言不变味,还能控制情绪和语速 TTS-Next:这个比较狠,从“配音”升级到“做完整音频作品”,一次生成人声、音效、环境音,多角色音色一致、全程不变声;48kHz输出 直接瞄准播客、有声书、影视、游戏、广告等场景 Realtime:全双工,可同时说和听,可打断、能共情、能无缝切换语言、对话中能调用Agent工具完成任务 #阿里语音模型 #QwenAudio

AIGCLINK

15,356 Aufrufe • vor 5 Tagen