阿里刚刚开源了TTS:Fun-CosyVoice3 0.5B,zero-shot音色克隆,可本地部署 还开源了款ASR【Fun-ASR-Nano 0.8B】,Fun-ASR的轻量化版本,推理成本更低,可以本地及定制化微调 另外,Fun-CosyVoice3模型做了升级,首包延迟比之前降低了50%,WER降低了56.4%,复杂场景字符错误率降低了26% 支持9种通用语言、18种中文方言、9种情感控制,可以跨语种音色复刻,比如说,用一段普通话录音可生成粤语、日语、英语等 支持双向流式合成,“输入即发声”,这个适用于语音助手、直播配音、无障碍阅读等等实时场景 Fun-ASR也升级了,噪声场景下准确率到了93%,新增歌词与说唱识别能力,支持31种语言自由混说无需预先指定语种 覆盖7大方言和26种地方口音,流式识别模型的首字延迟降低到了160ms...

AIGCLINK's profile picture

AIGCLINK

35,508 Aufrufe • vor 8 Monaten

阿里昨晚放出了最新款TTS:Qwen3-TTS,秒级克隆、一句话设计新音色、实时流式输出,0.6B 可跨语种多语,中文克隆后直接说英日韩德法俄西葡意+ 四川话、北京话等方言,音色不变 Dual-Track双轨架构,输入1个字就能出首包音频,端到端延迟97 ms,可以做直播、实时翻译、AI客服了 用它做有声书,可以一人分饰多角,情绪、方言全有了 有1.7B和0.6B两个尺寸,1.7B性能最优,具备控制能力,0.6B均衡性能与效率 #tts #Qwen3TTS

AIGCLINK's profile picture

AIGCLINK

125,016 Aufrufe • vor 7 Monaten

又发现 GitHub 上一款开源强大的文本转语音工具:Abogen。 能快速将 ePub、PDF 或文本文件转换成高质量音频,并生成匹配的字幕。 GitHub: 主要特性: -...

GitHubDaily's profile picture

GitHubDaily

31,126 Aufrufe • vor 1 Jahr

一个轻量级的数字人项目:MiniMates,支持语音和表情两种驱动模式,可在普通电脑上实时运行 one-shot单图驱动,最低只需要一张图片 可以说话、眨眼、转头、做表情等 支持实时交互,实时摄像头表情捕捉、实时头部跟踪、实时语音对话 github: #数字人 #AI虚拟人

AIGCLINK's profile picture

AIGCLINK

35,360 Aufrufe • vor 1 Jahr

绝了,刚刚阿里在除夕夜发布了新模型 Qwen-3.5-plus ,赶紧试了一下,一句话就生成了这样一个 3D 展车厅 🤯 据说这次 Qwen-3.5-plus 实现了从纯文本模型到原生多模态模型的代际跃迁,每百万...

Ding's profile picture

Ding

151,357 Aufrufe • vor 6 Monaten

谷歌的升级版医疗模型出来了,开源了:MedGemma 1.5,可离线运行 MedGemma 1.5在上一代基础上,增加了对3D CT、MRI扫描,以及全切片病理图像的支持 能分析胸片时间序列,这对疾病进展监测比较有用;还能解剖定位,在X光片中识别特定的解剖结构 能从医疗实验室报告中提取结构化数据,这对于整合患者信息、辅助决策很方便 另外,配套还发了一款医疗ASR:MedASR 专为医疗场景微调的语音识别模型,胸片口述词错误率...

AIGCLINK's profile picture

AIGCLINK

147,253 Aufrufe • vor 7 Monaten

Memo AI 1.3.5 重磅更新,支持纯本地离线说话人识别分类!隐私会议,对话场景不用上传云端也能区分说话人。当然还有: 1. Cuda 模式转写速度较 GPU 提升...

Memo AI's profile picture

Memo AI

34,929 Aufrufe • vor 2 Jahren

Distil-Whisper:让语音识别的速度提高 5.8 倍,参数减少 51%,准确度保持在 99%。 Whisper 在语音识别方面表现卓著,但是它有一个明显的缺点:训练出来的小模型支持的语言比较少,而大模型推理速度又很慢。如果你有海量的数据需要处理,或者对实时性要求略高,那使用 Whisper 可能会让你比较头疼。...

Barret李靖's profile picture

Barret李靖

124,227 Aufrufe • vor 2 Jahren

语音圈真的炸了,这个github开源黑科技把AI语音干到了离谱的程度,项目叫 VoxCPM2,已经揽获 22.9k star。 你用自然语言描述一个声音,它就能帮你生成出来。 不用找参考音频,也不需要任何样本,直接就能出效果。 更绝的是它的克隆能力。 随便找一段音频扔进去,它可以 1:1...

阿西_出海's profile picture

阿西_出海

52,651 Aufrufe • vor 2 Monaten

又在 GitHub 上发现一个专为快速构建 Web 应用的强大 AI 编程助手:Claudable。 将本地 CLI...

GitHubDaily's profile picture

GitHubDaily

11,926 Aufrufe • vor 1 Jahr

Skywork 上线了视频 Agent 能力,他们这个流程有意思 你可以从第一个分镜开始,左边生成之后,将生成的视频和音频素材发到右边的视频编辑器里面去进行编辑。 支持使用主流的视频模型和能力,文生、图生、首尾帧都有,另外支持生成音乐和语音。 我用首尾帧做了一条香水广告的演示,还不错。 也上线了一些特效模版,你可以不用管提示词直接复用。 而且会员从昨天(0106)开始会有为期七天的无限使用优惠,只要你是会员就可以一直用。 最近有需求的朋友们可以看看,说不定这几天直接回本了。

歸藏(guizang.ai)'s profile picture

歸藏(guizang.ai)

18,228 Aufrufe • vor 8 Monaten

字节、港中文等最新搞了一个专用于人-物交互的端到端视频生成模型:OmniShow,妥妥的电商广告专用模型 全模态,一个模型通吃图+音+姿势+文本输入 任务可以覆盖R2V、RA2V、RP2V、RAP2V四种生成模式,目前应该是唯一一个支持同时用图像+音频+姿势+文本混合输入的 人脸保持、物理合理性、表现力及口型同步看起来效果都还可以 原生长镜头生成,最长可生成10秒连续视频 目前代码还没放出来 #人物视频生成模型 #OmniShow #电商视频生成

AIGCLINK's profile picture

AIGCLINK

22,802 Aufrufe • vor 4 Monaten

最近中文推里,Rachel🥥 的数字人skill 太火了 如果你也想使用这个Skill, 算了一遍成本才发现,从声音克隆、配音到人物视频生成,每一层都在收费。10 秒视频要花 $1 左右。 本着独立开发者精神,能省则省的思路。...

左海有个洲's profile picture

左海有个洲

19,480 Aufrufe • vor 1 Monat

在 GitHub 上发现一款完全本地运行的开源 AI 助手:Eclaire,集成了超多 AI 功能。 支持文档、图片、笔记、书签等数据类型的统一管理,并通过本地 LLM...

GitHubDaily's profile picture

GitHubDaily

26,221 Aufrufe • vor 11 Monaten

写自动化测试脚本或者写爬虫时,用传统的 Playwright 往往需要频繁维护各种元素选择器。 一旦目标网页的结构发生微调,原有的脚本就容易直接报错罢工,维护起来颇为费神。 最近在 GitHub 上看到到 HyperAgent 这个开源项目,巧妙地将...

GitHubDaily's profile picture

GitHubDaily

17,999 Aufrufe • vor 5 Monaten

🔥 YouTube 是最学英语最好的平台! 【100个精选频道 + 全流程学习法👇】 🌍 从入门 ->...

暖暖爱AI's profile picture

暖暖爱AI

48,660 Aufrufe • vor 9 Monaten

谷歌也发布了一个根据输入图片和音频就能生成对应人物讲话视频的项目VLOGGER。看起来没有阿里那个自然。 项目简介: 它可以根据一张人物图像,生成由文本和音频驱动的说话人视频。该方法建立在最近生成式扩散模型取得成功的基础之上。 VLOGGER 包含两个关键组件: 1) 一个随机的人体到 3D 运动的扩散模型;...

歸藏(guizang.ai)'s profile picture

歸藏(guizang.ai)

31,198 Aufrufe • vor 2 Jahren

这种数字人直播间的搭建成本不到500一个月你敢信? 之前老刷到这种数字人直播, 今天好奇去问了朋友到底怎么搞的, 结果这门槛低到让我有点惊讶。 现在已经可以做到“半无人”实时驱动了: 真人只需要坐在镜头前,系统拉取摄像头, 靠本地音频就能实时驱动口型,主播全程不用开口说话 不仅能正常加投流,重点是成本算下来竟然不到500 这下业内真不用再担心主播跳槽或者跑路了 AI确实在不知不觉中改变了很多行业的玩法……

莫森 | 破局哥's profile picture

莫森 | 破局哥

35,694 Aufrufe • vor 6 Monaten

🙇‍♀️📚练习口语哪家强?基本都要靠翻墙! 👉推荐三种学习英语口语的方法: 我们上学时积累了一定的英语基础,出国也能勉强交流。 想在口语听力以及表达上提升? 相信这三个方式也会很适合你。 一、TED-Ed: TED 的教育频道: 1️⃣...

摆烂程序媛's profile picture

摆烂程序媛

39,801 Aufrufe • vor 3 Jahren