正在加载视频...

视频加载失败

最终的实验产物,应该算是成功了。 亮点在于里面的角色动态并不是 AI 生成的,而是抽取的图片帧进行对口型播放。 也就是说,在本地,用一个 python 脚本就能驱动,不需要消耗任何 AI 额度,也能达到不错的效果。 人物的问题解决了,接下来就是研究怎么让 AI 自己做视频。 等完全研究明白了,会开源的。

14,971 次观看 • 15 天前 •via X (Twitter)

0 条评论

暂无评论

原始帖子的评论将显示在这里

相关视频

谷歌终于想明白了:科学家就该专心搞研究,产品还是得交给商人。谷歌最近对AI业务进行了一次大重组。DeepMind CEO Demis Hassabis已经退出日常运营,把主要精力放回AGI研究上。老板Sergey Brin看起来正在接手Gemini的日常运营。简单来说,谷歌正在把AI的研究和产品两部分拆开,也是第一家巨头这么干。 今天,谷歌想把Gemini做成什么也越来越清楚了。谷歌正在让Gemini从一个只会回答问题的模型,变成一个真正能帮你干活的Agent。Sergey Brin说过,AI真正成为“超能力”,是在它能以人类根本无法达到的规模去做事情的时候。 这个从产品角度出发的理解,其实和科研角度非常不一样。站在科研角度,AI的“超能力”是做到人类做不到的事情,比如治愈所有疾病。但站在产品角度,AI根本不需要会做人类做不到的事,它只需要把人类本来就能做的事情,做得更快、更多、更大规模。 现在最好的例子就是AI编程。人类当然也会写代码,但AI可以用人类根本无法匹敌的速度和规模去写。从产品角度来看,AI竞争已经不再只是比谁的模型更强了。 而这恰恰是谷歌最大的优势。谷歌本来就已经拥有一整套用户每天都在使用的强大产品。如果它能成功把这种Agent能力真正塞进现有的产品生态里,那谷歌很可能会轻松赢下这场AI大战。

GeLun Ding

52,174 次观看 • 3 天前

做AI短视频,我踩过 5 个坑 今天全说出来,希望你能少走一些弯路。 ──────────────── 第一坑:一上来就猛学 刚开始做的时候,我每天研究工具、研究技术、研究别人怎么做。研究得很起劲,但回头一看,一个视频都没做完。 正确的顺序是先做出来,再边做边学。做完第一个你懂了流程,做完几个你有了感觉,就这样进步 总结一句:先完成,再完美 ──────────────── 第二坑:总想省钱省积分 生图要钱,生视频要钱,心疼是真的 刚开始做的时候,我也试过那些便宜的方案,效果看起来差不多。实际用下来,各种问题,花了大量时间去调,最后还是放弃了。 成本要跟结果比,不是跟价格比。做一个视频的成本本来就不高,省那点钱,丢的是时间和机会。 总结一句:用最好的工具,做最好的作品 ──────────────── 第三坑:死抠画面 刚开始做的时候,总想把画面做得很精美。结果发现根本做不到,提示词再好也有上限。 后来才发现,很多播放量很高的视频,画面并不精致,但内容抓人、节奏好,照样爆。 总结一句:别死抠视觉,够用就行。 ──────────────── 第四坑:忘了内容本身 这是最大的坑 刚开始做的时候,我花了大量时间研究工具、研究技术,结果忘了自己是做内容的 我们做的是视频,第一件事是内容好不好,不是特效漂不漂亮。 把注意力放回内容上之后,效果立刻就不一样了。 总结一句:我们是做内容的,不是研究AI的 ──────────────── 第五坑:做得太少 做一个感觉效果不好,就开始大改、大优化。其实很可能是这个方向用户不感兴趣,换一个方向就好了。 只要数量足够多,总会有跑通的 总结一句:干就完了,量大出奇迹 ════════════════ 我现在用什么工具 工具不用多,我现在核心就靠Creao 🔹 视频生成— 支持 Google Veo 和 Seedance,提示词直接出视频 🔹 图片生成— 最高 4K,随时在对话里生成 🔹 配音 — 20 多种声音,直接出音频文件 🔹 Agent 自动化 — 流程搭好之后可以定时跑,不用每次手动 可以试试: 最后一句:别光收藏,动手才能进步

Powerpei🦅🏆买美股上币安

22,183 次观看 • 24 天前

英伟达黄仁勋在沙特接受访谈完整版👇 沙特要造AI工厂! 一出手就是500兆瓦的部署, 跟谁合作? 英伟达。 这背后是什么逻辑? 用能源炼AI! 这事得从英伟达和沙特一家叫Humane的AI公司说起。 两块Blackwell芯片,就重得拿不动。 功耗多少?2500瓦。 而沙特要建的,是500兆瓦的计算基础设施。 想想这规模 人工智能,公认的革命性技术, 可能是任何时代最具变革性的。 它会改变每个行业, 成为每个行业的基础设施。 沙特的Humane公司, 就要在当地建设这个AI基础设施。 但很多人没意识到, AI不仅是变革技术, 它本身就是个产业。 一个制造业! 这个制造业需要什么?能源。 沙特有什么?能源。 通过英伟达这种AI超级计算机, 本质上就是AI工厂。 能源驱动这些AI工厂,生成tokens。 这些token再被重组成应用程序和解决问题的AI。 这就是Humane要为沙特和世界创造的东西。 基础设施搞定了,创新就看模型了。 生成式AI很火,但黄仁勋还提到了别的。 物理世界和物理AI。 这跟生成式AI、跟英伟达提供给Humane的平台,是什么关系? 过去12年,AI产业发展神速。 最早是感知AI:能识别猫、文字、声音、语音。 感知AI进化到生成式AI:用文字生成文字,文字生成图像,文字生成化学物质和蛋白质。 现在是第三个时代:AI能推理。 这种能力的应用就是智能体AI(Agentic AI)。 它有自主性,能用工具、能推理、能解决问题,就像电脑里的数字机器人。 下一个时代,英伟达正在攻克的, 是理解物理规律的AI。 物理世界的常识:瓶子倒了会掉下来,理解重力、惯性、因果、物体恒存性、遮挡等等。 这些我们人类的常识,要教给AI。 下一代物理AI,结合已有的技术,可以被赋予物理形态。 这个物理形态,就是机器人技术。 AI的时代发展飞快,今天我们身处智能体AI世界,很快就会进入机器人或物理AI的世界。 Humane这家公司,源于沙特王储的愿景。 要在AI全价值链上发力。 建设大规模数据中心,目标是到2030年达到1.9吉瓦。 还要推进AI芯片、云、模型、应用和解决方案。 沙特的目标, 是建设自己国家的AI基础设施,参与并塑造这项变革性技术的未来。

墓碑科技

214,713 次观看 • 1 年前

你对AI视频的认知,99%都是错的 你是不是觉得,AI视频创作就是“输入提示词,抽卡式出图,再用剪映拼起来”?那些在闲鱼、小红书上标价几百块的AI视频单子,都是些赚不到钱的“小打小闹”? 如果你的答案是“是”,那么恭喜你,你对AI视频的认知,可能还停留在上个世纪 一个残酷的现实是:当大多数人还在怀疑和观望时,一小撮“超级个体”已经利用AI完成了商业模式​的重构,悄悄地赚得盆满钵满。 我们来看看几个“不起眼”的赛道: ​中小学教师的“刚需”:你可能不知道,为了评职称、参加比赛,中小学教师对高质量微课视频的需求是绝对的刚需。 看看淘宝,那些标价几百的微课制作服务,很多销量早已过万,而这仅仅是标价,一个定制化的数学或物理动效微课,最终成交价远超你的想象。 这在当下的经济环境中,是国内少有的暴利刚需业务。 ​闲鱼上的“暴利”生意​:一个60秒的AI视频,市场价在200-600元 但如果你用传统“图生视频”的模式,可能需要花费5个小时,时薪不到100元,苦不堪言。 而先行者已经找到了能“一键生成分镜、自动组成视频”的神器,将效率提升数十倍。 ​降维打击的“商业片”:你知道现在一个美院团队,制作一秒高质量的AI动画广告,报价是多少吗? 答案是1000元左右。而现在,一个人,借助合适的工具,就能实现从脚本、分镜、配音、字幕到剪辑的全流程自动化,效果直接媲美专业团队。 从产品推广、AI短剧、动态壁纸,到PPT转动画、产品Demo演示……AI视频创作的商业应用版图,正在以超乎想象的速度扩张。 这个时代,不再需要庞大的团队和昂贵的设备。 “创意”第一次成为了个体最核心,乃至唯一的资产。 而要抓住这个风口,你缺的不是创意,而是一个能将你的创意无限放大的“神器”。 Medeo的目标只有一个:让视频创作的门槛,彻底消失 它不仅仅是“文生视频”或“图生视频”,而是一个全流程的视频创作智能体。 就算你不会剪辑、不会写脚本、甚至不会写AI提示词,只要你有一个好点子,Medeo就能一键帮你: 生成专业脚本和分镜 生成匹配的关键帧画面 自动添加配音、字幕和背景音乐 支持多轮对话,对不满意的片段随时修改 最终自动剪辑成片 无论是产品推广、专业广告、知识科普,还是AI短剧,效果都直接爆炸。 我知道,你可能会有两个疑问: ​1. “它真的有那么强大吗? 很多工具都只是噱头。”​Medeo的核心优势在于其“分镜”逻辑,它能理解视频的叙事结构,而不是无脑生成单张图片 这使得镜头之间的配合度极高,故事感和流畅度远超传统AI视频工具。事实上,它大大减少了“抽卡”次数,这已经很大程度的减成本。 ​2. “这么强的工具,一定很贵吧?”​是的,它不便宜。 但请允许我提出一个你必须了解的核心事实:贵,不是Medeo的问题,而是AI时代下范式​的转变,而是当前整个AI视频生成领域的技术成本决定的。 你看到的每一次流畅的画面生成,背后都是海量算力的燃烧和昂贵GPU资源的消耗 这就像第一代iPhone,价格不菲,因为它集成了当时最前沿的技术。AI视频创作,就是当下的那个“前沿技术”。 所以,问题的关键不是“它为什么这么贵”,而是“它到底为我省了多少钱?” 让我们来算一笔账: 一个专业的美术或动画团队,制作一秒高质量AI动画的报价,是​1000元​。 一个传统的视频制作公司,完成一个商业广告片的报价,动辄​数万甚至数十万​。 而现在,Medeo将这个过去只有少数专业机构和企业才能负担得起的“视频工业能力”,压缩到了一个你触手可及的工具里。 它不是让你“多花钱”,而是将你的成本​从“团队级”指数级降低到了“个体级”​。 这本身就是一场颠覆性的成本革命。 相信我,随着技术迭代,成本一定会逐步降低 而现在,正是利用这个“信息差”和“能力差”建立优势的最佳时机。 AI带来的不是失业,而是对“个体价值”的重新洗牌。 在这个新的范式下,你不再是一个执行者,而是一个指挥AI军团的“导演”。 你的核心任务,是思考你能为世界创造什么样的独特价值。 不要再用过去的认知来审视现在的世界。 旧的地图,找不到新的大陆。 现在,Medeo官网 已经开放,并且提供免费积分让你亲身体验。 去试试看,亲自感受一下,那个属于“超级个体”的时代,已经到来了

叫我阿杭

23,034 次观看 • 7 个月前

把网站录下来给AI看, AI能照着做出来吗? 刚刚看到了个炫酷的灯具网站, 它有个功能是点击按钮直接能看到灯点亮的效果, 甚至网站的配色也会暗淡下来, 特别有氛围. 我突然想到, 这样的网站, 如果要让AI来做, 该怎么办? 把源代码拷给它? 用一个巨复杂的 prompt 来完成? 有没有可能, 我录个视频, 展示一下这个"关灯"的效果, 然后让AI来按照视频来写网站? 于是, 这个重任就交给了今天测试的模型, 百度刚出的文心-5.0-preview, 全模态大模型, 这个模型同时支持文本, 图片, 音频, 视频作为输入, 然后可以生成文本和图片, 所以我们这个测试可以最大化的利用它的能力. 我先录制了网站的效果, 然后写了prompt作为补充, 告诉它这个效果是怎样的, 以及准备的图片材料在哪里. 值得一提的是, 网站所展示的图片也是我用文心-5.0-preview生成的. 大家可以看视频中我生成的效果. 直接说测试结论: 目前每个模态都是可用的, 而且模态之间关联性非常好, 我测试了视频+文本, 图片+文本, 图片+语音, 都可以完成任务. 当然测试也发现了一些问题, 比如 token 输出速度不是特别快, 以及偶尔会有超时问题(已反馈给百度的同学). 我的使用建议是, 多利用它的多模态能力, 来完成之前不敢想象的任务, 它真的提升了使用场景的天花板. #文心大模型 #文心5 #百度 #文心一言 #ai教程

karminski-牙医

29,929 次观看 • 8 个月前