Loading video...

Video Failed to Load

Go Home

今天玩 seedance2 越玩越心里害怕,下午即梦已经做人物生成限制了。 非常可怕在于,基于大量视频数据集(可能是抖音?),我试着把上周年会活动随便找张照片发上去生成视频,画面是包厢里的一角,结果视频能把画面外大差不差给还原回来,包括另外两面墙和天花板。这只是一家不出名也开没几年的普通饭店。 影视飓风 Tim 也紧急发了一条影片,讲了只要用他的照片,就能自动生成他的声音,以及也能生成他办公室前后的对应画面。 可以说 seedance2.0 是一个掌握大量现实世界的空间和声音的模型,这可能是未来世界模型的极高起点。 人类可能已经打开了潘多拉的魔盒?

36,418 views • 5 months ago •via X (Twitter)

0 Comments

No comments available

Comments from the original post will appear here

Related Videos

视频生成模型的下一站,可能不是更长、更清晰的片子。 而是一个你能走进去,并亲手改变的世界。 过去两年,AI 视频已经能生成足够惊艳的画面。但无论视频多逼真,观众依然只能按下播放键: 镜头往哪里走,早已决定; 街角后面有什么,你无法靠近; 画面里出现什么,你也不能临时改变。 生成结束的那一刻,所有可能性也结束了。 Alaya Lab 刚刚开源的 AlayaWorld,试图把这件事反过来。 它不是先生成一段完整视频,再让你观看。 你可以用一张图片开启世界,推动摇杆改变镜头和移动方向;画面会随着操作继续生成。探索途中还能切换提示词,召唤火焰、凤凰、巨兽,或者让新的事件直接发生在当前场景里。 这意味着,AI 生成的内容第一次不只是“成片”,而开始接近一个可以进入、探索和影响的环境。 目前公开的几个核心指标: • 15B 参数 • 720p 分辨率 • 24 FPS 实时生成 • 支持 60 秒以上的连续探索 • 支持实时镜头控制与提示词切换 但真正困难的还不只是生成速度。 视频模型一旦连续运行,误差会逐帧累积:向前走了一段,再回头看,刚才的建筑可能已经变形;人物、道路和空间关系也会慢慢漂移。 这也是“生成视频”和“生成世界”的分水岭。 视频只要下一帧看起来合理。 世界却必须记得:东西在哪里、刚才发生过什么,以及你离开后再回来时,它是否还是原来的样子。 AlayaWorld 为此加入了两种互补的记忆: 一个显式 3D cache,用来保存空间位置; 一个压缩的帧历史,用来维持时间连续性。 再配合针对漂移历史的训练和 Error Bank,尽量阻止误差在长时间生成中不断放大。 所以这项工作的重点,不是“又一个画质更好的视频模型”。 而是把交互、空间记忆、长时稳定和实时生成,塞进同一个可以运行的系统里。 它现在当然还不是一款普通玩家打开电脑就能玩的游戏,也不能直接替代成熟的游戏引擎。 但它展示了一种很值得关注的方向: 未来的虚拟世界,未必需要把每栋建筑、每条道路和每个事件提前制作完成。 一部分世界,可能会在玩家移动和行动的同时,被模型实时生成出来。 这会影响的不只是游戏。 AI 原生玩法原型、影视预演、虚拟勘景、动态故事板,甚至机器人与智能体的训练环境,都可能从这种“可交互的生成世界”中长出来。 更难得的是,AlayaWorld 不只发布了 Demo。 模型权重与推理代码已经开放。你可以直接查看它如何处理实时交互、空间记忆和长时间生成,也可以下载权重进行研究与复现。 如果你正在关注世界模型、AI 游戏或交互式生成,这个项目值得拆一遍: Alaya Lab

知识猫图解

67,302 views • 10 days ago

过去两年,AI 视频一直在卷画质、时长和真实感。 但对世界模型来说,生成得越长,反而越容易暴露一个致命问题:它根本记不住自己刚刚生成过什么。 AlayaWorld 想解决的,就是这个比画质更难的问题。 一段视频,只要前后几帧看起来连贯,观众通常不会深究背后的空间是否真的存在。 但世界不一样。 你往前走了一段路,转身回来,刚才的房子还得在那里。 你中途召唤了一只怪物,模型不但要马上给出反馈,还得让这件事自然地发生在同一个世界里。 这也是为什么世界模型最难的地方,不是生成,而是状态管理。 AlayaWorld 为这件事加了三层机制: 1. 3D Cache 负责记住东西在哪里。模型离开一个区域再回来时,可以重新找到之前的空间信息。 2. 压缩后的画面历史负责记住刚才发生了什么。它不需要把所有旧画面一直塞进上下文,但又不能把过去全部忘掉。 3.漂移训练和 Error Bank,负责处理模型自己制造的错误。因为生成时间越长,前面一个小错误就越可能污染后面的所有画面。 看到这里,我突然发现,世界模型和 Agent 其实在解决同一个问题。 Agent 运行久了会 context rot,忘记原始任务,被错误的历史信息带偏。 世界模型运行久了也会,只不过它忘记的不是文字,而是街道、建筑、人物和刚刚发生过的事。 所以 AI 的下一场竞争,可能不只是生成质量。 视频模型比的是单次输出。 世界模型比的是持续运行。 谁能让 AI 在运行过程中记得住、改得动、错了还能拉回来,谁才有机会把一次生成变成一个真正可以进入的世界。 AlayaWorld 目前还更像研究级原型。公开的推理流程需要首帧图片、相机轨迹和 Prompt,离普通人打开网页就能玩还有距离。 但它已经把推理代码和模型权重公开了。 这个方向终于不只是看一段官方 Demo,而是可以被下载、检查和验证 Alaya Lab

泊舟

478,341 views • 10 days ago

AI 视频生成,到各种 AI Agent,我一直在思考一个问题:AI 最终会如何改变人类创造和体验数字世界的方式? 最开始,AI 帮助我们生成文字和图片;后来,它开始生成越来越逼真的视频。但无论画面质量提升到什么程度,这些内容依然存在一个限制——我们仍然只是观看者。我们可以欣赏 AI 创造出来的场景,却无法真正进入其中,也无法与这个世界产生互动。 最近体验 Alaya World Alaya Lab 后,我第一次感觉,AI 视频生成正在探索一个新的方向:它不只是生成一段视频,而是在尝试生成一个可以被探索的世界。 Alaya World 是 Alaya Lab 推出的交互式视频世界模型。用户可以通过文字、图片或者视频作为初始条件,让模型生成一个动态世界。不同于传统视频生成模型“输入 Prompt,输出一段固定视频”的方式,Alaya World 更像是在探索过程中持续构建环境,用户可以在生成的世界中移动视角,并通过交互指令触发新的事件。 这也是我认为世界模型和普通视频生成模型最大的区别。 过去的视频生成模型解决的是“如何生成一段更加真实的视频”,而世界模型尝试解决的问题是“如何让一个世界持续存在”。如果你进入一个虚拟城市,向前探索,然后回头,你期待看到的是同一个城市,而不是一个重新随机生成的场景。 这背后涉及世界模型最核心的挑战:长时间生成的一致性。模型不仅需要知道下一帧画面应该是什么,还需要理解空间关系、历史状态以及用户行为对世界造成的影响。 Alaya World 在技术层面通过空间记忆机制、历史信息保留以及抗漂移训练等方式,提高长时间生成过程中的稳定性。目前模型支持 720p / 24 FPS 实时流式生成,并展示了超过一分钟的连续探索能力。 让我觉得这个方向有意思的地方,是它可能会重新定义未来数字内容的生产方式。 以游戏行业为例,过去一个虚拟世界需要大量人工制作:美术设计地图、程序编写规则、策划设计剧情。开发者需要提前创造一个固定世界,而玩家进入后按照既定规则体验。 但如果世界模型进一步发展,未来的游戏可能不再只是“开发者搭建世界,玩家进入世界”,而是“开发者定义规则,AI 实时生成世界”。玩家体验的不再是一个完全预设好的内容,而是一个随着交互不断变化的环境。 当然,Alaya World 目前仍然处于早期阶段。实时生成所需的算力成本、复杂环境理解能力,以及更长期、更稳定的世界一致性,都还有很多问题需要解决。但它让我看到一个值得关注的趋势:AI 的竞争可能不会只停留在生成更漂亮的图片和视频,而是进一步走向创造更真实、更连续、更可交互的世界。 过去,人类通过电影记录想象,通过游戏创造虚拟空间。而未来,也许我们只需要描述一个想法,AI 就可以帮助我们生成一个能够进入其中、探索其中的世界。 从生成内容,到生成世界,这可能是 AI 下一阶段最值得期待的变化之一。

Ashlyn He

11,573 views • 9 days ago

把网站录下来给AI看, AI能照着做出来吗? 刚刚看到了个炫酷的灯具网站, 它有个功能是点击按钮直接能看到灯点亮的效果, 甚至网站的配色也会暗淡下来, 特别有氛围. 我突然想到, 这样的网站, 如果要让AI来做, 该怎么办? 把源代码拷给它? 用一个巨复杂的 prompt 来完成? 有没有可能, 我录个视频, 展示一下这个"关灯"的效果, 然后让AI来按照视频来写网站? 于是, 这个重任就交给了今天测试的模型, 百度刚出的文心-5.0-preview, 全模态大模型, 这个模型同时支持文本, 图片, 音频, 视频作为输入, 然后可以生成文本和图片, 所以我们这个测试可以最大化的利用它的能力. 我先录制了网站的效果, 然后写了prompt作为补充, 告诉它这个效果是怎样的, 以及准备的图片材料在哪里. 值得一提的是, 网站所展示的图片也是我用文心-5.0-preview生成的. 大家可以看视频中我生成的效果. 直接说测试结论: 目前每个模态都是可用的, 而且模态之间关联性非常好, 我测试了视频+文本, 图片+文本, 图片+语音, 都可以完成任务. 当然测试也发现了一些问题, 比如 token 输出速度不是特别快, 以及偶尔会有超时问题(已反馈给百度的同学). 我的使用建议是, 多利用它的多模态能力, 来完成之前不敢想象的任务, 它真的提升了使用场景的天花板. #文心大模型 #文心5 #百度 #文心一言 #ai教程

karminski-牙医

29,929 views • 8 months ago