Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

这下不光PS, AE也要被替代了? 修图大模型你见过, 修视频大模型你见过吗? 来看这个新视频生成框架 MotionStream, 它最大的特点就是指哪打哪, 相信大家都经历过耗费了无数token, AI视频就是不按照自己的想法走. 这个框架可以让你通过鼠标绘制运动轨迹, 真的让视频中的元素按照你的想法运动, 同样, 运镜也不在话下, 甚至如果想偷懒模仿大师的场景和运镜, 直接把原片拷进去, 就能把里面的动作迁移到你的视频里. 最重要的, 这个模型是基于阿里万相修改的! 大小只有1.3B和5B! 游戏显卡都能跑. 当前目前框架还处于早期, 运动太快会导致下次和变形, 但十分有潜力, 建议持续关注. 最后, 这个论文是Adobe研究院发的,那AE没事了哈哈哈哈 项目地址:

31,520 Aufrufe • vor 10 Monaten •via X (Twitter)

9 Kommentare

Profilbild von 一位比特国王👑
一位比特国王👑vor 10 Monaten

作为从事了十几年的电商设计主管,我还是有一定的发言权的,确实现在很多工作都交给AI处理了 以前拍美食图都要专业的摄影师才能达到商用效果,现在豆包直接就可以生成商业级别的图片; 以前抠图要用钢笔工具慢慢扣,现在直接用稿定设计自动化抠出来; 未来肯定会有越来越多复杂的技术被AI所替代; 我们公司的设计师已经砍半50%了,未来不容乐观,从设计师到要饭是必经之路。

Profilbild von disjoint
disjointvor 10 Monaten

点开之前:我的adobe股票要完蛋了😭 点开之后:我的adobe股票有救了😍

Profilbild von 灰机
灰机vor 10 Monaten

我们都有一个大胆的想法

Profilbild von Eition Quek
Eition Quekvor 10 Monaten

有人懂吗 我在上ae课刷到这个帖子

Profilbild von BTC八戒
BTC八戒vor 10 Monaten

这个框架真是太酷了,期待能带来更多创作自由!

Profilbild von LEO LI
LEO LIvor 10 Monaten

Profilbild von CatPressMax
CatPressMaxvor 10 Monaten

提示词是新的编程语言,不好用就直接上图形界面,以后AI视频成成应该和3D动画制作类似了

Profilbild von 朱YU
朱YUvor 10 Monaten

玩A I以来最大的感触就是不要费脑筋学习,碰到问题等人家新模型出来就解决了

Profilbild von LeoDDD
LeoDDDvor 10 Monaten

"AE也要被替代了?" 怀疑标题是为了我骗我点show more🐶

Ähnliche Videos

我靠我靠我靠!!!!这回跨境电商真的要大洗牌了,不用hypit的公司一定会死掉,真的是我见过至今为止最牛逼的克隆Video AI产品,这个做素材的效率真的太高了,而且这个产品现在已经开源了,直接在GitHub上就能找得到!!这样的项目赶紧点个star,不然之后找不到了 一条 26 秒的 YouTube Shorts,加一张同时拍到两只银猫的生活照,我真的用 Hypit 复刻出了一条 26.13 秒的新视频 我说的只有一句:/hypit 模仿这个YouTube Shorts视频保留原视频的榜单结构、四个动作笑点和竖屏节奏,把角色全部换成照片里的两只猫 第一次付费生成大约 6 分钟跑完:4 张 GPT Image 2 场景图、4 段 Seedance 2 Mini 视频,8 个模型任务全部一次成功,最终成片 1080×1920,30 fps,实际成本 1.39 美元,我仔细复盘了一下他这个产品的制作模式 它先把原片拆成 #5 翻滚、#3 叠手、#2 模仿拉链声、#1 双猫合唱四个语义段落,再把角色、动作提示词、视频、音轨、字幕、排名动画和渲染关系组织成一套可以继续修改的 Workflow 这条 26 秒的视频里,一共有 4 个语义段落、4 段生成视频、一条音轨和 20 个图形项 每个排名什么时候亮,哪段字卡什么时候出现,哪个动作配哪段声音,都能在 Source、Preview 和 Timeline 里继续检查 真的,这应该是我至今为止见过最牛逼的AI Video产品,它不是另一个视频模型,也不是一个只会帮你写提示词的 Agent,他是真的一个特别强的Harness 视频模型负责生成素材;Hypit 负责把 Script、Media、Semantic Time、Tracks、Graphics 和 Render 组织成一套可追踪、可修改、可复用的视频程序 Clone 的不是某一帧,是一条视频背后的生产结构。 如果你想用 AI 做内容变现,真正值钱的不是偶尔抽中一个漂亮镜头,是同一套结构能不能持续换角色、换产品、换文案,只有模板化的东西才能实现像素级对标 GitHub: 做 AI 视频、短视频矩阵或者系列化内容的,建议先收藏这个仓库,顺手点个 Star,我把素材放评论区了,你们也可以试一试

叫我阿杭

378,440 Aufrufe • vor 8 Tagen

真正言出法随的AI视频工具,终于被我找到了!! 而且还是个100%开源的视频世界模型项目! 这个用来做视频真的很高级! 先说一个长期的“痒点”,做AI视频为了保证空间场景的一致性, 不得不生成一大堆各种角度的场景的图片作参考约束, 要确保正反打都不会穿帮,要确保镜头转过去再转回来场景不走形, 但其实,这个方法很原始! 但如果,直接可以生成一个高度一致性的空间, 让人物站在该有的位置,并且还能够自由控制镜头在空间里的运动, 所有一致性的困扰,就全部解决了!! AlayaWorld Alaya Lab 就完全是这个思路, 根据任何图片和视频,实时渲染一个自由空间, 先固化一个场景,然后人物和道具进场,先搭景再拍摄, 这样做视频的体验,就无限接近于真实片场! 你就像一个导演,站在片场里,并且拥有“言出法随”的能力! 改天气、换演员、换服装、甚至直接换场景,可玩性和可控性全部拉满, 突发奇想的指令或者是已经设置好“技能”,就可以实时渲染出来! 而且这个时长不受限制,一个空间里,“拍摄”多久都可以。 想想就很爽,这种创作体验,是前所未有的!! 不光是视频,这也完全是彻底改变游戏行业的存在。 尤其是那种沉浸感很强的第一人称游戏! 越说越激动,这个项目现在是完全开源的, 有兴趣的朋友,真的可以关注一下这方面的趋势, 我觉得在这个探索世界模型的阶段, 这个,就是最好的落地应用!!

沐阳

31,236 Aufrufe • vor 2 Monaten

OpenAI 的大神 Andrej Karpathy 前几天在他的 YouTube 频道讲了一堂课,系统的介绍了大语言模型,内容深入浅出,非常赞,抽空将它翻译成了双语,由于内容较长,我将分批上传,以下是第一部分精校后的双语视频,字幕文稿如下: Intro: Large Language Model (LLM) talk 大家好。最近,我进行了一场关于大语言模型的 30 分钟入门讲座。遗憾的是,这次讲座没有被录制下来,但许多人在讲座后找到我,他们告诉我非常喜欢那次讲座。因此,我决定重新录制并上传到 YouTube,那么,让我们开始吧,为大家带来“忙碌人士的大语言模型入门”系列,主讲人 Scott。好的,那我们开始吧。 LLM Inference 首先,什么是大语言模型 (Large Language Model) 呢?其实,一个大语言模型就是由两个文件组成的。在这个假设的目录中会有两个文件。 以 Llama 2 70B 模型为例,这是一个由 Meta AI 发布的大语言模型。这是 Llama 系列语言模型的第二代,也是该系列中参数最多的模型,达到了 700 亿。LAMA2 系列包括了多个不同规模的模型,70 亿,130 亿,340 亿,700 亿是最大的一个。 现在很多人喜欢这个模型,因为它可能是目前公开权重最强大的模型。Meta 发布了这款模型的权重、架构和相关论文,所以任何人都可以很轻松地使用这个模型。这与其他一些你可能熟悉的语言模型不同,例如,如果你正在使用 ChatGPT 或类似的东西,其架构并未公开,是 OpenAI 的产权,你只能通过网页界面使用,但你实际上没有访问那个模型的权限。 在这种情况下,Llama 2 70B 模型实际上就是你电脑上的两个文件:一个是存储参数的文件,另一个是运行这些参数的代码。这些参数是神经网络(即语言模型)的权重或参数。我们稍后会详细解释。因为这是一个拥有 700 亿参数的模型,每个参数占用两个字节,因此参数文件的大小为 140 GB,之所以是两个字节,是因为这是 float 16 类型的数据。 除了这些参数,还有一大堆神经网络的参数。你还需要一些能运行神经网络的代码,这些代码被包含在我们所说的运行文件中。这个运行文件可以是 C 语言或 Python,或任何其他编程语言编写的。它可以用任何语言编写,但 C 语言是一种非常简单的语言,只是举个例子。只需大约 500 行 C 语言代码,无需任何其他依赖,就能构建起神经网络架构,并且主要依靠一些参数来运行模型。所以只需要这两个文件。 你只需带上这两个文件和你的 MacBook,就拥有了一个完整的工具包。你不需要连接互联网或其他任何设备。你可以拿着这两个文件,编译你的 C 语言代码。你将得到一个可针对参数运行并与语言模型交互的二进制文件。 比如,你可以让它写一首关于 Scale AI 公司的诗,语言模型就会开始生成文本。在这种情况下,它会按照指示为你创作一首关于 Scale AI 的诗。之所以选用 Scale AI 作为例子,你会在整个演讲中看到,是因为我最初在 Scale AI 举办的活动上介绍过这个话题,所以演讲中会多次提到它,以便内容更具体。这就是我们如何运行模型的方式。只需要两个文件和一台 MacBook。 我在这里稍微有点作弊,因为这并不是在运行一个有 700 亿参数的模型,而是在运行一个有 70 亿参数的模型。一个有 700 亿参数的模型运行速度大约会慢 10 倍。但我想给你们展示一下文本生成的过程,让你们了解它是什么样子。所以运行模型并不需要很多东西。这是一个非常小的程序包,但是当我们需要获取那些参数时,计算的复杂性就真正显现出来了。 那么,这些参数从何而来,我们如何获得它们?因为无论 run.c 文件中的内容是什么,神经网络的架构和前向传播都是算法上明确且公开的。

宝玉

1,124,686 Aufrufe • vor 2 Jahren

过去两年,AI 视频一直在卷画质、时长和真实感。 但对世界模型来说,生成得越长,反而越容易暴露一个致命问题:它根本记不住自己刚刚生成过什么。 AlayaWorld 想解决的,就是这个比画质更难的问题。 一段视频,只要前后几帧看起来连贯,观众通常不会深究背后的空间是否真的存在。 但世界不一样。 你往前走了一段路,转身回来,刚才的房子还得在那里。 你中途召唤了一只怪物,模型不但要马上给出反馈,还得让这件事自然地发生在同一个世界里。 这也是为什么世界模型最难的地方,不是生成,而是状态管理。 AlayaWorld 为这件事加了三层机制: 1. 3D Cache 负责记住东西在哪里。模型离开一个区域再回来时,可以重新找到之前的空间信息。 2. 压缩后的画面历史负责记住刚才发生了什么。它不需要把所有旧画面一直塞进上下文,但又不能把过去全部忘掉。 3.漂移训练和 Error Bank,负责处理模型自己制造的错误。因为生成时间越长,前面一个小错误就越可能污染后面的所有画面。 看到这里,我突然发现,世界模型和 Agent 其实在解决同一个问题。 Agent 运行久了会 context rot,忘记原始任务,被错误的历史信息带偏。 世界模型运行久了也会,只不过它忘记的不是文字,而是街道、建筑、人物和刚刚发生过的事。 所以 AI 的下一场竞争,可能不只是生成质量。 视频模型比的是单次输出。 世界模型比的是持续运行。 谁能让 AI 在运行过程中记得住、改得动、错了还能拉回来,谁才有机会把一次生成变成一个真正可以进入的世界。 AlayaWorld 目前还更像研究级原型。公开的推理流程需要首帧图片、相机轨迹和 Prompt,离普通人打开网页就能玩还有距离。 但它已经把推理代码和模型权重公开了。 这个方向终于不只是看一段官方 Demo,而是可以被下载、检查和验证 Alaya Lab

泊舟

479,007 Aufrufe • vor 2 Monaten