Загрузка видео...

Не удалось загрузить видео

На главную

一个翻唱《小情歌》的下面对这首歌的精准评价定位: “这首歌很奇怪 ,像表白,像分手,又像重逢”

767,592 просмотров • 3 лет назад •via X (Twitter)

Комментарии: 0

Нет доступных комментариев

Здесь появятся комментарии из оригинального поста

Похожие видео

1/ star-cover 0.1版本 诞生啦!!一个本地跑的 AI 翻唱工作站。 想介绍一下我做这个的初衷,音乐是我的爱好之一,比重还挺高,一直想听喜欢的歌手唱自己私心喜欢的歌曲。 AI翻唱现在已经很普遍了,技术也很成熟,但是前期准备多,后期处理比较麻烦,所以想自己试试能不能打通。 2/ 把运行链路稳定了一轮。 修了 ffmpeg 找不到、bat 双击闪退、模型缓存路径、RVC 基础模型缺失这些问题。现在本地 CUDA、BS-Roformer 分离、RVC 转换、混音这一整条链路可以比较稳定地跑起来。其实这些我之前都不懂,跟着F5和codex干就完了。 3/ 补了一批歌手模型:Taylor Swift、Bruno Mars、Rihanna、ROSÉ,加上原来的周杰伦。 4/ 今天最大的改动是 GUI,终于落实。 之前用 cmd 和 Gradio 表格凑合跑,但群星分句特别难用。于是重做成自定义网页 UI:暗色界面、歌手卡片、任务摘要、逐句编排列表。 单歌手翻唱是一键跑;群星模式可以每一句选歌手、调变调、批量分配。 5/ 群星分句这个功能开始像“制作台”了。 一首歌先分离人声,再转录成一句一句。每句可以指定不同歌手,比如主歌周杰伦,副歌 The Weeknd,某几句 Rihanna,再单独给几句升降调。 6/ 下一步想训练一个更具体的音色:04-07 年周杰伦演唱会时期那种金属嗓。 今天也整理了训练思路:素材要偏现场、颗粒感强、观众声少、伴唱少。RVC 能学音色和共鸣,但“撕裂感”很依赖原始唱法,所以素材质量会决定上限。 今天输出的歌曲谈不上完美,继续优化。 有对这个项目感兴趣的,有建议的欢迎留言,我会持续改进并分享。 #BuildInPublic #AI #VoiceAI #IndieHackers

信手斩龙

11,814 просмотров • 1 месяц назад

Google推出了一种在 StableDiffusion 图像生成中保证内容特征一致性的方式。 这个其实是现在图像生成中一个非常重要的问题,故事可视化、游戏开发资产设计、广告等都需要在生成的时候具备角色或者内容的一致性。 从演示来看效果非常好人物角色和其他内容的特征都保持的非常好,他们有一个示例是一个男人的一生十几张不同年龄段的图片都很像能看出来是一个人。 而且这个项目还可以跟 SD 已有的控制方式结合,比如局部重绘和 Controlnet 等。下面是具体的介绍: 实现方法: 身份聚类:这一步骤涉及首先生成一系列图像,然后将这些图像嵌入到一个语义空间中。接着,使用聚类算法将这些图像分组,每个组代表一种可能的角色身份。这个过程旨在识别出一组视觉上一致的图像,从而确定角色的主要视觉特征。 身份提取:在确定了一组具有高内聚性的图像之后,接下来的步骤是通过在这些图像上训练模型来提炼出一个更一致的角色身份。这意味着模型将学习到特定角色的关键视觉特征,以便在未来的生成中更准确地重现这些特征。 收敛性:方法的最后一个步骤是迭代过程,该过程在达到一定的收敛标准时停止。在每次迭代中,模型基于最新的训练数据生成新的图像,并重新进行聚类和身份提取。这个过程重复进行,直到模型能够可靠地生成具有一致视觉身份的角色为止。 效果验证: 定性和定量比较:在这一部分,作者将他们的方法与其他个性化文本到图像生成技术进行比较。这包括通过视觉和数值指标来评估生成图像的一致性和质量。 用户研究:作者还进行了一项用户研究,以评估他们的方法在实际使用中的效果。这包括让用户评价生成图像的一致性和吸引力。 消融研究:这部分是对方法中不同组件的效果进行评估。通过修改或移除方法的某些部分,作者能够理解每个组成部分对最终结果的贡献。 论文链接:

歸藏(guizang.ai)

125,824 просмотров • 2 лет назад