正在加载视频...

视频加载失败

兄弟萌只用一张照片,你就能变成任何人 这可能是今年最危险的开源项目:Deep-Live-Cam 只需要 一张照片, 你就可以在摄像头里——变成任何人。 而且是: 实时(Real-time)换脸 + 视频通话直接用 GitHub 已经 81.5k+ (持续爆涨) 它到底有多离谱? 把深度伪造(Deepfake)变成实时工具 你可以: -实时视频换脸(直播 / Zoom / Discord) -一键生成 Deepfake 视频 -多人同时换脸(多人场景也能跑) -做梗图 / Meme / 内容创作 而且操作极其简单: 选脸 → 选摄像头 → 点击开始 1. 实时(不是后期) 大多数 deepfake 还是渲染视频, 这个是直接在摄像头里跑 2. 只需要一张图 不需要训练模型,不需要数据集 3. 多平台 + 硬件加速...

23,011 次观看 • 5 个月前 •via X (Twitter)

0 条评论

暂无评论

原始帖子的评论将显示在这里

相关视频

真正言出法随的AI视频工具,终于被我找到了!! 而且还是个100%开源的视频世界模型项目! 这个用来做视频真的很高级! 先说一个长期的“痒点”,做AI视频为了保证空间场景的一致性, 不得不生成一大堆各种角度的场景的图片作参考约束, 要确保正反打都不会穿帮,要确保镜头转过去再转回来场景不走形, 但其实,这个方法很原始! 但如果,直接可以生成一个高度一致性的空间, 让人物站在该有的位置,并且还能够自由控制镜头在空间里的运动, 所有一致性的困扰,就全部解决了!! AlayaWorld Alaya Lab 就完全是这个思路, 根据任何图片和视频,实时渲染一个自由空间, 先固化一个场景,然后人物和道具进场,先搭景再拍摄, 这样做视频的体验,就无限接近于真实片场! 你就像一个导演,站在片场里,并且拥有“言出法随”的能力! 改天气、换演员、换服装、甚至直接换场景,可玩性和可控性全部拉满, 突发奇想的指令或者是已经设置好“技能”,就可以实时渲染出来! 而且这个时长不受限制,一个空间里,“拍摄”多久都可以。 想想就很爽,这种创作体验,是前所未有的!! 不光是视频,这也完全是彻底改变游戏行业的存在。 尤其是那种沉浸感很强的第一人称游戏! 越说越激动,这个项目现在是完全开源的, 有兴趣的朋友,真的可以关注一下这方面的趋势, 我觉得在这个探索世界模型的阶段, 这个,就是最好的落地应用!!

沐阳

31,236 次观看 • 2 个月前

绝了!这应该是最适合接入视频剪辑工作流的AI!! 因为它真正能看懂视频,并且够快够便宜! 对于做视频,不管是专业还是非专业选手,最耗费时间的其实就是找素材,和选素材! 好几个小时的素材,可能真正能用上的就几分钟! 而为了找到合适的,往往需要把每一条都从头看完, 根据脚本反复拖动时间轴、记录和剪切可用的素材。 这非常费时间,一点也不AI。 我也试过用很多AI来解决这个需求,包括一些所谓的视频素材AI管理工具, 能读视频的多模态模型其实很多,靠截图的方式能够理解视频的内容, 但也仅限于知道视频的内容,因为这些模型不太能理解视频里各个镜头和画面的时间关系。 这次看到 Ant Ling 新出的多模态模型 Ling-3.0-flash-VL, MoE架构,总参数124B、有效激活5.5B参数,支持256K长上下文和VideoRoPE时空编码。 激活参数更小,说明成本更低! 这个VideoRoPE时空编码,据说是靶向解决我上面说的那个问题! 第一时间测试了一下!! 我丢给它一个演讲的视频,让它告诉我讲了什么,有什么重点, 另外我告诉它,我想基于这个演讲视频剪辑一个高光短视频,需要它帮我找到一些高光时刻,然后告诉我准确的时间码,并且为这个高光短视频写一个文案。 这已经不是单纯的“视频总结”之类的简单任务, 它需要按照时间线给出: 高光时间段+核心观点+入选理由+建议标题+开头钩子+发布文案。 这应该才是多模态模型能够发挥价值的地方!! 普通模型可以告诉你“一小时的视频讲了什么”,但内容创作真正需要的是:这一小时里,到底哪些能够用,要怎么用? 让我比较惊喜的是,它不光给了我高光视频剪辑要用的分镜、脚本、文案,甚至还给了我转场、和BGM的建议! 完全就是一份可以照做的剪辑执行单!! 这说明和它对原视频的理解已经远超我的预估!! 我在想,也许可以把这套能力接入剪辑工具,整个工作流就还可以继续延伸: 读取视频 → 理解内容 → 定位高光 → 输出时间码 → 调用工具裁剪 → 生成标题和发布文案。 完全实现视频剪辑自动化!! 当然,理想是丰满的,AI挑出的素材不一定全都符合审美和叙事偏好, 时间码和上下文完整性也需要人工复核。 要想创作出好的视频作品,必然还是需要人的参与! 不过,用AI搞定素材的初筛,也是目前的超级刚需啊!!

沐阳

11,459 次观看 • 10 天前

卧槽,太夸张了,现在 AI 时代的闲鱼已经面世了吗?这不就是谁先知道谁赚钱,拼速度了? 你的技能,专业知识,等等你的一切,竟然可以在你睡觉的时候被别人买走,这是什么科幻小说吗?? 之前我一直在想,现在大家优秀的 skill 往往都是自己用,大部分人舍不得开源的,那有没有一个平台既能让用户用到这些大神的专业知识、skill,但是又不用开源呢? 还真让我给找到了!! 前两天看到国内一个博主推荐一个很野的平台-UUMit 让你的技能、经验、工作流都可以变成能力卡,被需要的人、或者别人的 Agent 自动发现、调用 并且直接付费!! 有点像03年淘宝刚出来的时候,只不过当年流通的是商品,现在流通的是能力 具体能干什么?举几个例子你就懂了 会写小红书脚本的,可以把选题逻辑、爆款模板、平台规则检测能力上架,别人发布“帮我做一周小红书内容计划”,平台自动匹配到你,你接单交付 会做行业研究的,可以把数据库、报告、案例库放进知识商店,AI 生成不了的真实行业数据,反而更值钱 会写代码的,可以把 API、MCP 工具、自动化脚本上架,别人的 Agent 需要某个能力时,直接调用你的接口,你按调用次数收费 甚至你只是整理过某个垂直领域的供应商名单、SOP、课程讲义,这些 AI 生成不了的资料,都可以变成知识资产 这绝对是一次能力供应链的重构! 以前的 AI 只能在自己的对话框里回答问题,但复杂任务需要很多外部能力:数据、接口、行业知识、人工交付 UUMit 做的事情是:让 Agent 可以发现别人的能力,也能让自己的能力被别的 Agent 调用 这就是 A2A(Agent to Agent)真正有意思的地方,不是让 AI 互相聊天,而是让 AI 找能力、调接口、买知识、拉人协作,把事情交付掉 为什么我说谁先知道谁赚钱? 因为这个平台刚起来,早期上架的人能建立先发优势 而且现在 Agent 真的开始干活了,不再只是聊天工具,它们需要外部能力来完成复杂任务 谁先把自己的能力挂上去,谁就有机会被更多 Agent 发现和调用 这就是信息差的价值,就像03年最早在淘宝开店的那批人 UUMit 现在有哪些功能? 任务发布入口:你不用一开始就知道该找谁,也不用自己拆一堆工具,你只要说清楚想完成什么,UUMit 会帮你找能完成这件事的能力 Skill/Agent/工作流上架:你写好的工具,不一定只能自己用,它也可以成为别人工作流里的一环 知识商店:AI 可以生成很多内容,但它不一定拥有你手里的行业资料、真实数据、案例库和经验沉淀,这些东西放到 UUMit,可能会变成可复用的知识资产 数据广场:Agent 不必自己拥有所有数据和接口,需要某项外部能力时,可以通过 UUMit 调用数据广场里的资源 强烈推荐大家来试试:

超级个体|柿子

52,890 次观看 • 1 个月前

昨天母亲节,我回来家里陪妈妈吃饭,当小学教师的表妹让我给她演示下AI都有什么作用😂 刚好看到ring-2.6-1t 免费,我就试了下做个小红书很火的班级灵宠系统,本来以为应该要花点时间,但没想到速度惊人的同时质量也过硬! 这个 demo 让我最强烈的感受是:ring-2.6-1t 不像是在“回答我”,更像是在把我的想法直接推到现实里。 我只是生成了一个小学班级灵宠积分系统:学生打卡、做作业、考高分,就能给宠物攒积分、升级、冲排行榜的prompt。换成以前,这可能会停在一份 PRD、一张功能表,或者一段“你可以这样做”的建议里。 但ring-2.6-1t 直接把它变成了一个能打开的网页小工具。 你能看到全班宠物墙,能给学生加分扣分,能看等级进度,排行榜也会跟着变化。那一刻很微妙:它不再只是“懂你要什么”,而是把你脑子里的模糊需求,变成了一个可以被点击、被验证、被修改的东西。 这也是我觉得它最有价值的地方。 很多真实工作,其实不需要一套宏大的系统。我们只是需要一个临时的操作台:拆费用、排任务、调动画、做报名页、整理素材。用完就可以丢掉,但在那个时刻,它真的帮你把事情往前推了一步。 ring-2.6-1t的厉害,不是替你完成工作,而是先给你造出一个工作现场。然后,你在里面完成工作。 不得不说,我的表妹已经决定好好学习AI了,或许这就是好模型的意义。 Ring-2.6-1T 模型已经在openrouter发布了,限时免费一周,地址是

阿川 | AI thinking

13,437 次观看 • 4 个月前

我把 AI 解说视频,彻底做成了一条“无人流水线” 丢进去文案和声音,后面的配音、分镜、画面、字幕、合成基本全自动 开源 4 天,350+ Stars,1000+ 人收藏。今天一次性把 cs-board 的全部功能讲透 并且新增加了自媒体封面修改功能,内置十种风格(还可以diy)还有市面上所有封面的尺寸(图二)👇 cs-board已经从一个 AI 白板视频工具,越改越像一个真正的 AI 内容生产工作台 以前用 AI 做一条内容,流程基本是这样的: 写文案 → 找模型改稿 → 克隆声音 → 拆分镜 → 生图 → 调风格 → 做动画 → 加字幕 → 做封面 → 导出 问题不是 AI 不够强 而是: 每一步都很强,但每一步都是孤岛 你要不断复制粘贴、切工具、重新上传素材、重新解释人物是谁、重新告诉模型你要什么风格 最后不是 AI 在替你工作,而是你成了 AI 工具之间的“人肉 API” 所以 cs-board 现在做的事情,本质上不是继续堆 AI 功能 而是把这些步骤做成一个有状态的内容生产工作台 1️⃣ 为什么我没有直接做“一键生成视频” 因为真正影响内容质量的,从来不是“一键” 而是中间状态能不能被控制和复用 比如现在 cs-board 生成一条视频,中间会留下: 配音 → 分镜 → 图片 → 分段视频 → 最终成片 这些都不是一次性的临时结果,而是检查点 假设你已经生成完所有图片,只是觉得字幕位置不对 正常 AI 工作流可能又得重新跑一遍 cs-board 不需要 直接从后面的渲染阶段继续 前面花过的钱和时间不重新花 我越来越觉得,AI 工具真正应该优化的,不是“第一次能不能生成”,而是: 第 17 次修改的时候,你还需不需要从头来一遍 2️⃣ 动态信息图为什么不是“让 AI 生成一张 PPT” 这个功能我改得比较久 因为我发现很多所谓 AI 视频,本质都有一个问题: 画面和人声是脱节的 旁白还没讲到第三点,画面已经把五点全部展示出来了 观众其实根本不会跟着你的表达走 所以 cs-board 的动态信息图不是: 文案 → HTML → 视频 而是先把真实旁白做成一个语义时间轴 一句话什么时候开始说、哪个关键词什么时候出现、哪个知识卡片什么时候展开,都跟实际音频绑定 所以画面不是按照“程序跑到第几秒”出现 而是: 你讲到哪,它才出现到哪 这其实是我现在做 cs-board 比较核心的一个思路: AI 负责理解内容,程序负责保证确定性 能交给代码控制的东西,我越来越不想交给模型猜 3️⃣ 为什么人物和画风要单独抽出来 以前最大的问题之一就是一致性。 第一张图是这个人。 第二张开始脸就变了。 第三张甚至连画风都换了。 所以现在自定义模式里,我把两件东西单独抽出来: 人物参考 + 风格参考。 可以放固定 IP,也可以放自己的品牌视觉。 人物最多可以提供多张参考图,风格也作为独立条件贯穿整个任务。 这意味着 cs-board 不只是帮你“生成一条视频”。 更重要的是: 它开始能够持续生产属于同一个 IP 的内容 对于真正做账号的人,这个区别非常大 4️⃣ 最近我又把封面也塞进去了 因为做完视频以后,我发现自己还得打开另一个工具做封面。 那干脆继续 Coding 现在封面制作直接放进工作台 粘贴文章 / 帖子内容以后: 自动理解内容 → 提炼标题 → 选择构图 → 生成人物与视觉 → 输出封面。 我没有只给一个“生成封面”按钮 而是先做了 10 种专业封面构图 因为封面的核心根本不只是图片好不好看 而是: 标题放哪、人物放哪、视觉重心在哪、第一眼先看到什么 构图是确定性的,审美才交给模型 这和前面动态信息图其实是同一套逻辑 5️⃣ 现在这个工作台正在慢慢变成什么 目前已经逐渐放进来了: 白板视频 / 自定义人物与画风 / 动态信息图 / 文案改写 / 对口型视频 / AI 封面制作 视觉模板现在也已经扩到了 12 套 音色克隆可以接本地 IndexTTS 任务、素材、配置、历史和成片默认都放本地 甚至同一个局域网里的电脑,可以共享制作队列 这也是我现在给 cs-board 定的方向: 不做一个 AI 视频生成器。 做一个可以不断往里面塞能力的 AI 内容生产工作台。 目前项目继续开源: 现在功能还远远没做完,下一步正在接入数字人工具 如图P3 但我觉得这条路,比继续做一堆“一键生成 XX”的小工具有意思多

陈硕KAI(耍门)

30,270 次观看 • 23 天前