语音圈真的炸了,这个github开源黑科技把AI语音干到了离谱的程度,项目叫 VoxCPM2,已经揽获 22.9k star。 你用自然语言描述一个声音,它就能帮你生成出来。 不用找参考音频,也不需要任何样本,直接就能出效果。 更绝的是它的克隆能力。 随便找一段音频扔进去,它可以 1:1... show more

阿西_出海
52,296 次观看 • 1 个月前
用了一段时间 Seedance 2.0,我用了几百次,试着做了短剧、商业广告、文旅宣传片、生活互动小视频、个人vlog,聊点真实感受。 AI 视频从"生成"进入了"创作"时代。以前我们在"用 AI 做视频",现在是"用 AI 拍片"。... show more

Adam也叫吉米
27,536 次观看 • 5 个月前
千问开源Qwen3-TTS 除了常规的文本生成语音,还支持设计声音和语音克隆。分0.6B和1.7B两个大小。效果不错,速度也很快。语音克隆的音色还原还可以,但是情感还原上不如Index TTS2。 模型: 在线体验:

Gorden Sun
18,202 次观看 • 6 个月前
爽了,AI视频终于卷起来了,MiniMax H3 牛逼!!! Seedance 2.0 30% 的价格 + 2K... show more

余温
69,519 次观看 • 5 天前
发现一个开源的 AI 视频生成项目,GitHub 已经 7k star 了——InfiniteTalk 它支持图像转视频和视频转视频两种模式,都是语音驱动的。 给一张图片加一段音频,能直接生成说话的视频;给一段已有视频换音频,也能重新配音。... show more

阿西_出海
19,872 次观看 • 1 个月前
还记得阿里巴巴那个让照片说话的EMO项目吗 ? 微软的VASA-1项目也实现了这个功能 单人像照片+语音音频=超逼真的人脸视频 效果炸裂,比EMO那个效果还好

小互
131,280 次观看 • 2 年前
这个skill玩的停不下来,产生成动态视频效果不错 不需要GPU,用CPU就可以玩 关键是完全用自然语言就行,渲染也很快(第一次渲染要下载插件,当然都是cc帮你做了) 调整也非常快速,就是写一个tsx文件, 还能自动配音TTS,我修改了一下用的index tts2的配音 最后直接下载保存就可以

huangserva
52,170 次观看 • 6 个月前
用 Codex 加 ChatCut,我终于能用自然语言丝滑剪辑我的视频了! 最近一直在研究这个 ChatCut 的 CodeX 插件... show more

来碗牛肉粉
17,728 次观看 • 20 天前
发现一个能把任何电子书变成Claude Code skill的项目,叫 book-to-skill 解决了看书的痛点:你买了本实用的技术书,认真读完,三个月后就忘了讲了什么。 这个项目把整本书变成Claude Code随时能调用的skill,调用它再加上电子书路径,就能自动拆成核心总览、分章节笔记、术语表、速查表。 拆完后这个skill就会以书名命名,你只需要输入书名,它会给你整本书的核心总结 如果你带着具体问题问,它会自动去对应章节里找答案讲给你听。 而且这些章节都是按需加载的,你不问到的部分不会占用上下文。

阿西_出海
11,541 次观看 • 29 天前
很久之前我就说过,用户的需求从来就不是写 prompt 指挥 AI 而是直接说需求「做个抖音出来」 这就是技术和用户之间巨大的 Gap 但是,就在刚刚... 我打开... show more

Orange AI
287,568 次观看 • 1 年前
NVIDIA 刚推出了一个 0.6B 的语音辨识模型 叫 Nemotron-3.5-ASR 支持 40 种以上语言、实时串流输出——不需要... show more

Kafka
46,990 次观看 • 1 个月前
前两天用了ChatCut我以为它已经很牛了至少在某些程度上能替代剪映,没想到今天部署的这个开源项目OpenMontage更厉害,只需要接入大模型它就能直接帮你写好提示词分镜脚本,有哪里不对的还可以让它改,我刚就说了一句“帮我生成一个15秒的猫和老鼠的视频”,它就给我做了一个这样的视频出来,自从有了AI各行业的压力是越来越大了,以后动画设计那些我感觉越来越多人要失业了。

科技俊 | Tech Jun
33,048 次观看 • 22 天前
Distil-Whisper:让语音识别的速度提高 5.8 倍,参数减少 51%,准确度保持在 99%。 Whisper 在语音识别方面表现卓著,但是它有一个明显的缺点:训练出来的小模型支持的语言比较少,而大模型推理速度又很慢。如果你有海量的数据需要处理,或者对实时性要求略高,那使用 Whisper 可能会让你比较头疼。... show more

Barret李靖
124,227 次观看 • 2 年前
兄弟盟,AI 女友真的要来了~ 刚在 GitHub 看到一个挺有意思的 AI 项目,叫 AIRI。 它想做的事情其实很简单:... show more

开发者Hailey
34,171 次观看 • 5 个月前
吃瓜洼地烂事! 这个女的应该是被人做局了,这男的是想把别人吃干抹净!语音里那对男女说话很狂啊,男的说要把这个穿黄衣服女的打的不能再鹿邑待!女的说我们亲戚都关注你的抖音,只要我一声令下一二十个人等着你呐!🤣

罗翔——破幕推墙
34,669 次观看 • 1 个月前
卧槽,这个仓库思路我是挺佩服的~ 能把任意公开的 GitHub 仓库逆向工程成“原始自然语言提示(prompt)”。 简单说就是: 你输入一个 GitHub 仓库链接,它就会自动抓取仓库的结构、README、文件树等信息,用 AI(比如... show more

比特币橙子Trader
78,523 次观看 • 4 个月前
阿里昨晚放出了最新款TTS:Qwen3-TTS,秒级克隆、一句话设计新音色、实时流式输出,0.6B 可跨语种多语,中文克隆后直接说英日韩德法俄西葡意+ 四川话、北京话等方言,音色不变 Dual-Track双轨架构,输入1个字就能出首包音频,端到端延迟97 ms,可以做直播、实时翻译、AI客服了 用它做有声书,可以一人分饰多角,情绪、方言全有了 有1.7B和0.6B两个尺寸,1.7B性能最优,具备控制能力,0.6B均衡性能与效率 #tts #Qwen3TTS

AIGCLINK
124,252 次观看 • 6 个月前
国内也有自己的 Veo 3 模型了! 通义今天发布了通义万象 2.5 视频模型 一个重要的更新就是实现音画同步的视频生成能力 支持端到端输出与视频相关的音效、语音,同时可以唇形同步。

歸藏(guizang.ai)
15,388 次观看 • 10 个月前
我的 AI 编程能力又向前迈了一大步。 刚刚用 Claude Code 复刻了抖音 APP 的「钱包」功能,我不知道抖音有多少名工程师负责这个功能,但... show more

banboo
230,235 次观看 • 1 年前
字节新视频模型Seedance1.5 pro有个很牛🍺的点,目前只有它能做。 可以一句话复刻经典影视片段、热门片段,做出同款名场面效果,甚至人物的动作和台词都能直接复用,比如我做的这个经典你过来啊(沈腾熊猫版) 我还测试了X个cases (1/4)

卡尔的AI沃茨
24,172 次观看 • 7 个月前
每次去问那些大模型某个项目怎么样,得到的回复永远是那种模棱两可的万金油——“项目有潜力,但请注意市场波动”。听君一席话,如听一席话,完全不敢拿真金白银去信它。 但这两天仔细看了下 Sentient 的逻辑,尤其是那个 SERA 架构,我是真觉得有点意思。它没想着用一套通用的语料库来“忽悠”你,而是老老实实地在做“拆解”。 你问它 DOGE 的风险,它不是在那瞎编,而是像个老练的研究员一样,先把问题拆成几个维度:经济模型是不是通胀的?链上流动性池子够不够深?大户是不是在集中出货?它有一套自己的索引库,先找工具,再抓实时数据,最后才给你写结论。... show more

大魔王提莫
440,509 次观看 • 7 个月前