Загрузка видео...

Не удалось загрузить видео

На главную

第一个开源的具有实时对话能力的多模态模型:Mini-Omni ,支持端到端的语音输入、输出 Mini-Omni是清华大学启元实验室开源的项目,能听、能说也能实时思考,在实时语音交互上媲美GPT-4o 特点: 1、实时语音到语音的对话能力: 无需额外的ASR或TTS模型 2、边思考边说话: 能够同时生成文本和音频 3、流式音频输出: 支持流式音频输出 4、"Any Model Can Talk" 方法: Mini-Omni 可以将语音交互能力添加到其他模型中,为其他模型赋能 github: 论文: #LLM #实时语音对话LLM

52,501 просмотров • 2 лет назад •via X (Twitter)

Комментарии: 6

Фото профиля hupuzuqiu
hupuzuqiu2 лет назад

没看错的话用了whisper和cozyvoice,這和gpt4o不一样

Фото профиля OSDev
OSDev2 лет назад

rst @readwise save thread

Фото профиля choupiyang_x
choupiyang_x2 лет назад

我错了,“Mini-Omni is an open-source multimodel large language model that can hear, talk while thinking. Featuring real-time end-to-end speech input and streaming audio output conversational capabilities.”

Фото профиля guanguoxiong
guanguoxiong2 лет назад

能打断,然后及时回复吗?

Фото профиля SGM
SGM2 лет назад

@aigclink Can it generate speech like the following

Фото профиля choupiyang_x
choupiyang_x2 лет назад

不是端对端:“ With "Audio-to-Text" and "Audio-to-Audio" batch inference to further boost the performance.”

Похожие видео