Загрузка видео...

Не удалось загрузить видео

На главную

ElevenLabs 发布其对话语音助手: Conversational AI 2.0 相较于上一代有了巨大飞跃 亮点功能: 说话不尴尬了:它能听懂你什么时候停顿、什么时候在思考,不会中途打断你说话。 多语言切换很顺滑:你说中文,它说中文;你说西班牙语,它也能自动切换。 回答更“懂行”:它可以从你公司的知识库里直接找资料来回答你,不胡说。 批量打电话不求人:几百几千个客户,系统可以一次性给他们打电话发通知。 一个模型管两种互动方式:不用分开发文字和语音版本,省人力。

31,674 просмотров • 1 год назад •via X (Twitter)

Комментарии: 4

Фото профиля 小互
小互1 год назад

借助实时分析语音节奏与停顿信号(如“um”“ah”),AI 可判断何时等待、何时回应,避免打断用户或不自然的等待,使对话更像真实人类交流。 几乎没有延迟... 详细介绍:

Фото профиля Soccer Bot™
Soccer Bot™2 лет назад

Experience the bot completely reimagined. 🌟 A completely new design, reminders for match prediction, notifications when games are interrupted, continued or postponed. New commands like /features and /standings and new languages and much more.

Фото профиля ken lu
ken lu1 год назад

@readwise save

Фото профиля AIFUNS(海外账号,Claude镜像,ChatGPT充值)
AIFUNS(海外账号,Claude镜像,ChatGPT充值)1 год назад

很厉害

Похожие видео

ChatGPT 桌面端(原来的 Codex App)今天加入了语音控制,macOS 和 Windows 用户可以直接用嘴指挥 AI 干活了。 具体来说,你可以一边跟 ChatGPT 说话,一边让它操控电脑、启动 Codex 写代码、调度 ChatGPT Work 执行任务,全程不用打字。开着一个语音对话,同时管理多个后台 Agent(智能体),有点像一个人坐在那里口述指令,几个助手分头干活。 这个功能基于 GPT-Live,OpenAI 在 7 月 8 日刚上线的新一代语音模型。GPT-Live 最大的变化是全双工架构,也就是它能同时听你说话和给你回话,不用像以前那样等你说完、停顿、它再开口。遇到复杂问题,它会把推理任务丢给后台的 GPT-5.5 处理,自己继续跟你聊,不会卡住。 macOS 用户多了一个叫 Appshots 的功能:语音对话时,ChatGPT 可以直接看到你当前最前面的窗口,了解你在做什么,回答就更贴合上下文。比如你正在看一段代码,直接说“这个函数有什么问题”,它能看到屏幕内容来回答。Windows 用户暂时没有这个能力。 此外,iPhone 用户可以通过远程配对的方式,用 iOS 上的 ChatGPT 语音来操控桌面端的 Codex。等于你拿着手机在沙发上就能指挥电脑写代码。Android 支持还在路上。 今天全球同步推出,面向 Plus、Pro、Business、Edu 和 Enterprise 用户。免费用户暂不可用。

宝玉

89,993 просмотров • 2 месяцев назад

NVIDIA 发布了类似豆包语音聊天的大模型 NVIDIA 放出了 PersonaPlex-7B-V1, 一个 7B 参数的全双工实时语音对话模型, 你可以理解为开源版的豆包语音聊天! 这玩意儿最牛的地方在于: 真正的全双工, 也就是说它能一边说一边听. 你打断它? 没问题, 它能立刻停下来听你说. 你俩同时说话? 也能处理. 这就是为啥叫 "Full Duplex" (全双工), 跟打电话一样自然. 技术上怎么实现的? 采用双流配置架构, 监听流和说话流同时运行. 模型基于 Moshi 架构魔改, 用 Mimi 编码器把语音压缩成神经编解码器 Token, 然后 7B 的 Transformer 同时预测文本和音频 Token, 最后 Mimi 解码器输出语音. 整个过程是流式的, 延迟极低. 还有个骚操作: 双重提示条件化. 你可以给它一段声音样本当 "声音提示", 它就能模仿那个声音风格说话; 再给个文本提示定义角色人设, 比如 "你是一个耐心的客服", 它就按这个人设来对话. 声音 + 人设, 都能定制. 跑分成绩: 在 FullDuplexBench 基准测试上, 平滑轮换成功率 90.8%, 用户打断处理成功率高达 95%, 响应延迟只有 170ms, 打断延迟 240ms. 官方说在对话动态、延迟、任务一致性上都优于其他开源和商业系统. 限制嘛: 目前只支持英语, 推荐硬件是 A100 80GB 或 H100, 不是一般人能跑得起的. 看了下训练数据用的是 Fisher English 数据集, 不到 1 万小时. 好消息是采用 NVIDIA Open Model License, 商用可用! 模型地址:

karminski-牙医

25,426 просмотров • 8 месяцев назад

卧槽,我终于解决了英语学习的终极难题,任何基础的同学,按照我这个方法学习之后,百分之百可以告别哑巴英语! 方法论我就不展开介绍了,直接看视频,通俗易懂👇 说几点需要注意的事情: 1️⃣ 你肯定会说听不清,这是一种错觉,不存在听不清,你所谓的听不清,只是因为你脑子里在强行想文字,这段声音对应不上哪几个字,所以你才会把这种不适应总结为“听不清”。实际上哪有什么听不清,你只是不熟悉这段语音而已,你就把它当成鸟语,他怎么说你就模仿怎么说,重复几十遍,最后你发出的声音和这段声音一样,你再回头听最初的那句话瞬间就听懂了。难道“酱紫”你也听不清吗?“欧皓辰,我xuan你” 也听不清吗?那么大的声音都近距离进到你耳朵里了,怎么会听不清呢? 2️⃣ 有点书面英语水平的同学肯定会说:这不就是连读吗?错!这不是连读!如果你把他理解成连读,那就大错特错了!虽然连读的效果是一样的,但是底层思想和我要强调的思想完全不一样。所谓的连读底层思想还是先看字,然后通过文字去串起来模拟语音的效果,从根本上就搞错了。语言本来就是声音,你对这段声音采样,然后模仿这段声音,模仿几十遍和它做到一模一样,就 ok 了,下次再听到这段声音就会秒懂。 语言的本质是声音,人类漫长的历史长河中,语言很早就诞生了,而文字的诞生比语言本身晚了很多很多年,不要离开了文字就不能学语言了 不理解的同学可以回答一下这个灵魂拷问:文盲为什么会说话?

米开朗基杨

14,746 просмотров • 1 месяц назад

#川普 当年访问北京的时候, 你看 #习近平 背抄着手, 然后这给川普介绍龙的产生。 “我C!” 你这是吧,给川普说的话。 我C,这中文那句话, 谁都没有发现这个问题。 习这个人是骨子里看不起川普, 从来不提川普。 #王岐山 告诉他们说: “你们那个什么总统什么玩意啊……” 从来不说川普。 结果有人问他:“你咋从来不说川普中的名字?” “哎,你说的很对啊, 我从来不说那个人名字, 他不值得我一提。” 正文: 那么更重要的事情,他们知道:哇塞,习这个人是爱听好话的。 习这个人是骨子里看不起川普,从来不提川普,绝对看不起他。 你看看,就是当年访问北京的时候,你看他背抄着手,然后这给川普介绍啊,龙的产生。 我C,你这是吧,给川普说的话。 我C,这中文那句话,谁都没有发现这个问题,七哥最早说出来的。而且这是我发给了川普本人,是吧? 我说你看他,他不懂是什么意思。人家,我说你问人家什么叫龙的传人,多少历史,是埃及长还是中国长? 他说:“我们是中国传人啊,几千年文化。” 呃,这个,这家伙抄着手,我C。你看不起,从来不提川普的。 那么这回一听说要搞川普,他很高兴。王岐山就压根不提川普,从来不提川普一句。 王岐山跟美国人见面的时候,就穿着那个睡衣。那一次,只有七哥知道吧?这被公、被认可的吧。 穿着睡衣,第一不能录音,不能录像,还不对外说。穿着睡衣晃悠出来了啊。 中间一看,前面50个小学生拿着本啊,所谓的王岐山的中纪委的学生。 说这个啊,捋着胡子,哗哗地讲。然后告诉他们说:“你们那个什么总统什么玩意啊……” 从来不说川普。 结果有人问他:“你咋从来不说川普中的名字?” “哎,你说的很对啊,我从来不说那个人名字,他不值得我一提。”

喜马拉雅日本勇者村

23,419 просмотров • 4 месяцев назад

还记得第一次用ChatGPT时那种卧槽,这AI居然能这么聊天的震撼吗? 一夜之间,世界像被重新打开了。 现在,OpenAI又把这种王炸升级到了语音!看看视频,有点大聪明的感觉。 不过🗣️ GPT-Live,让AI聊天终于像真人聊天了,感觉以后的防诈系统又得升级了。 7月8日,OpenAI正式推出新一代语音模型GPT-Live。它不再是你一句我一句的对讲机,而是一部真正的电话。 核心突破叫做全双工,英文Full-Duplex。 以前用语音助手,你等它说完,它等你说完,跟用对讲机似的。GPT-Live可以同时听和说。你能随时打断它,它也能在你思考时安静等着。更绝的是,它会在对话里自然地插入嗯嗯、是啊这种语气词,表示它一直在认真听着。 更狠的是,遇到复杂问题,GPT-Live会自动把任务交给背后的GPT-5.5处理。所以它才能一边跟你聊着天,一边把复杂事情办了。 🚀 紧接着,GPT-5.6全家桶也来了 7月9日,GPT-5.6系列全量上线。三个模型:Sol(旗舰)、Terra(均衡)、Luna(轻快)。怎么选?复杂推理用Sol,日常用Terra,高频简单任务交给Luna。 付费用户默认是GPT-Live-1,免费用户是GPT-Live-1 mini。打开ChatGPT的语音功能就能体验。 来评论区说说,你第一次用新语音的感受? #GPTLive #OpenAI

Polo贱🕊️| Gate打金狗0Gas费

13,790 просмотров • 2 месяцев назад

女朋友一生气就切方言,男朋友一句都没听懂,字幕全听懂了。 四川话、粤语、英语、法语,11 句台词,AI 字幕一个字没改,11 句全对。 短片是我做的,字幕交给一个开源语音模型,它输出什么我就往视频里贴什么。右上角挂着"未人工修改",连男生结巴的那句"你你说啥"都原样留着。 同一段音频我喂给了 Whisper large-v3 做对照,差距比我预想的大: 粤语那句"你话过请我食饭㗎,唔好赖账",Whisper 写成"你曾說過請我吃飯的,不要賴帳",翻成书面中文了,粤语原文一个字不剩;这个模型写的是"你话过请我食饭噶唔好赖帐",唔、噶、话过全在,广东人一看就是原话。 四川话的"莫"和"要得",Whisper 写成"别"和"要的";它原样保留。 英语那句 "Seriously? You forgot again?",Whisper 整句漏掉,它一字不差。 这个模型叫 Hojo-ASR-Multi-V1。它改掉的规则只有一条:不翻译你说的话,你说什么字,它就写什么字。 视频之外我还单独跑了两轮数据。上一期 90 条欧洲五语种真人音频,干净音频它比 Whisper 略输一点,加噪和 1.4 倍速后反超,90 条里零语言误判、零幻觉,Whisper 则把一句意大利语认成了瑞典语。这期 30 条中文系加英语:普通话、英语双方全对;粤语按字算,它错 7%,Whisper 错 50%,错的全是"翻译"造成的;四川话它错 3%,Whisper 错 11%。 更有意思的是,模型页面到今天还写着"中文、英文待支持"。Credits 里鸣谢了 WenetSpeech-Chuan 和 WenetSpeech-Yue 两个川渝、粤语数据集,能力其实早就训进去了,只是文档没跟上。 想自己上手:pip install hojo-asr,权重 12GB 从 Hugging Face 拉,Mac 上 CPU 跑 float32 就行,峰值内存 20GB。前面接一个 VAD 按停顿切句再送进去,这是这类大模型底座语音模型的标准用法,逐句识别时语言切换更稳。输出是全小写无标点,做字幕直接用,要标点的场景自己补一步。 不适合谁:16GB 内存的机器别试;中文长音频我还没测过,这次只测了短句和这条短片。 Apache 2.0,商用也行。他们的官方账号是 HojoAI,roadmap 上写着推理引擎和小型化,什么时候能塞进耳机我会一直盯着,想跟进的可以关注一下。

雨哥向前冲

529,723 просмотров • 16 дней назад