Video yükleniyor...

Video Yüklenemedi

Ana Sayfaya Dön

兄弟们 这个配的上炸裂啊 PixVerse 推出了世界收一个“实时生成世界模型” 可以连续、无限、实时的生成视频画面,包括声音... 下面是我测试的一个实时效果 我选择了个战争场面 我让GPT帮我写好的文案和剧情 我来复制粘贴进行操作 它根据我的文案实时机械能画面和剧情生成,有点牛P啊 随时这只是个技术预览展示,但是对我的震撼还是蛮大的 你输入一句话 → 它开始生成视频; 你再继续说出你的需求 → 场景立刻改变、角色动作和画面等跟着变。 它可以做到: 🧠 语义理解:你说一句话,AI 能理解你这句话的意图和画面背景信息 🧩 实时生成:场景几乎零延迟渲染,像玩游戏一样流畅 🔁 持续生成:世界不会“结束”,而是会一直延伸和变化 🎮 可交互性:每一次输入都会即时影响画面、声音、结构

12,587 görüntüleme • 7 ay önce •via X (Twitter)

0 Yorum

Yorum bulunmuyor

Orijinal gönderinin yorumları burada görünecek

Benzer Videolar

2026年,AI 视频进入下半场,不再是比谁生成的画面更精美,而是比谁更"实时"。 最近我深度测试了 PixVerse R1 实时世界模型,它彻底打破了我作为产品设计师对"视频文件"的固有认知。 视频不再是 .mp4,而是一个活生生的、可交互的世界。 以往我们用 AI 视频:输入提示词,等待 1 分钟,得到结果。 在 R1 里:输入即所得。没有等待,没有重生成,画面随着你的意图流转。 这种"实时性"意味着 AI 视频从一种“结果变成了”过程“。它构建的是一个"持久的视觉宇宙"。你可以通过语言、情绪甚至肢体,实时重写你眼前的视觉现实。这就是所谓的"Playable Reality(可玩的现实)"。 我做了一个小试验:在R1里建立一个以印象派画作为基底的连贯世界,并通过我的意图,让这个世界的视觉风格和所处环境实时流转,最后融入音乐的律动。非常初级,但已经充满了想象的空间。 目前 R1 还处于早期测试阶段(非最终 UI),但这种"实时世界模型"的雏形已经足够震撼。比如光是一个教育领域,就可以看到教育的未来: 学习不再是看录像带,而是走进场景。想学在咖啡馆点餐?AI 实时生成一个咖啡馆。你想改变天气或氛围?说句话,世界立刻响应。这种沉浸感是传统视频无法比拟的。如果你对 AI 落地感兴趣,建议关注一下这个产品。 PixVerse目前赠送了几个邀请码,感兴趣的朋友请在这个贴点赞+评论,我会在24小时后抽取3位朋友赠送邀请码,让大家也体验一下这个创新式的AI产品。

Bear Liu

15,227 görüntüleme • 7 ay önce

AI 视频生成,到各种 AI Agent,我一直在思考一个问题:AI 最终会如何改变人类创造和体验数字世界的方式? 最开始,AI 帮助我们生成文字和图片;后来,它开始生成越来越逼真的视频。但无论画面质量提升到什么程度,这些内容依然存在一个限制——我们仍然只是观看者。我们可以欣赏 AI 创造出来的场景,却无法真正进入其中,也无法与这个世界产生互动。 最近体验 Alaya World Alaya Lab 后,我第一次感觉,AI 视频生成正在探索一个新的方向:它不只是生成一段视频,而是在尝试生成一个可以被探索的世界。 Alaya World 是 Alaya Lab 推出的交互式视频世界模型。用户可以通过文字、图片或者视频作为初始条件,让模型生成一个动态世界。不同于传统视频生成模型“输入 Prompt,输出一段固定视频”的方式,Alaya World 更像是在探索过程中持续构建环境,用户可以在生成的世界中移动视角,并通过交互指令触发新的事件。 这也是我认为世界模型和普通视频生成模型最大的区别。 过去的视频生成模型解决的是“如何生成一段更加真实的视频”,而世界模型尝试解决的问题是“如何让一个世界持续存在”。如果你进入一个虚拟城市,向前探索,然后回头,你期待看到的是同一个城市,而不是一个重新随机生成的场景。 这背后涉及世界模型最核心的挑战:长时间生成的一致性。模型不仅需要知道下一帧画面应该是什么,还需要理解空间关系、历史状态以及用户行为对世界造成的影响。 Alaya World 在技术层面通过空间记忆机制、历史信息保留以及抗漂移训练等方式,提高长时间生成过程中的稳定性。目前模型支持 720p / 24 FPS 实时流式生成,并展示了超过一分钟的连续探索能力。 让我觉得这个方向有意思的地方,是它可能会重新定义未来数字内容的生产方式。 以游戏行业为例,过去一个虚拟世界需要大量人工制作:美术设计地图、程序编写规则、策划设计剧情。开发者需要提前创造一个固定世界,而玩家进入后按照既定规则体验。 但如果世界模型进一步发展,未来的游戏可能不再只是“开发者搭建世界,玩家进入世界”,而是“开发者定义规则,AI 实时生成世界”。玩家体验的不再是一个完全预设好的内容,而是一个随着交互不断变化的环境。 当然,Alaya World 目前仍然处于早期阶段。实时生成所需的算力成本、复杂环境理解能力,以及更长期、更稳定的世界一致性,都还有很多问题需要解决。但它让我看到一个值得关注的趋势:AI 的竞争可能不会只停留在生成更漂亮的图片和视频,而是进一步走向创造更真实、更连续、更可交互的世界。 过去,人类通过电影记录想象,通过游戏创造虚拟空间。而未来,也许我们只需要描述一个想法,AI 就可以帮助我们生成一个能够进入其中、探索其中的世界。 从生成内容,到生成世界,这可能是 AI 下一阶段最值得期待的变化之一。

Ashlyn He

12,093 görüntüleme • 1 ay önce

玉伯之前发了一条推文,说问了很多牛人下一个大模型会有什么惊艳发布,其中一个预测是:可实时生成的视频。 其实我当时没太理解什么是实时生成视频,直到我看了 PixVerse R1 的演示视频,实际体验了一把,才算是理解了什么是实时生成视频,以及它带来的想象空间有多大。 PixVerse R1 可以说是全球首个实时生成模型了,是 PixVerse 自研的大模型。 如果你看了这个视频演示,你会发现它和传统的 AI 视频生成完全不是一回事。演示里是一个"魔法水族箱",金鱼在水草间游动,你打一句话,画面立刻响应。输入"一只小龙虾",红色的鳌虾就趴在石子上了;打"几只蓝色小水母",半透明的水母就漂出来了;说"一条鲨鱼",鲨鱼就从左边游进画面。不是生成完再播放,是你说一句、它变一帧,像在跟视频对话。 更厉害的是复杂交互。你打"一只手伸进去抓鱼",真的有只手从上方探入水中捞鱼;说"用渔网捞",绿色的捞网就出现把金鱼网住了。场景也能随便加——"出现一艘沉船",海盗船模型就沉在鱼缸里了;"掉进去一个棒棒糖",红白旋涡的巨型棒棒糖就躺在石子上,超现实。最离谱的是你还能控制镜头:打"镜头拉远,一个孩子正在看水族箱",视角瞬间从鱼缸内部切到外面,一个小男孩背对着你站在水族箱前。 在实际体验的时候,我也发现一个问题:人的反应速度跟不上视频生成的速度。AI 生成太快了,我写提示词的手速跟不上。但这应该不是大问题,完全可以语音指挥,让 AI 来实时写提示词。 实时生成这个方向打开的想象空间太大了。 直播?想象一下,主播说“今天心情好,给我换个海边背景”,下一秒人就站在马尔代夫的沙滩上了。弹幕刷“下雨”,雨就下了;刷“放烟花”,天上就炸开了。观众不再是观众,是共创者。 游戏?你对着屏幕说“我要进一个赛博朋克风格的酒吧”,酒吧就生成出来了,霓虹灯、全息广告、调酒机器人,全是根据你那句话现编的。不需要提前建模,每个玩家看到的世界都不一样。 教育?老师讲二战诺曼底登陆,不用再放 PPT 了,直接说“给我生成一段盟军抢滩的画面”,学生眼前就是士兵跳下登陆艇、冲向海滩的场景。讲到哪,演到哪。 互动影视?男女主角站在分岔路口,观众投票往左走还是往右走,视频实时往那个方向演下去。每个人看到的结局都可能不一样。 这模糊了视频和游戏、直播、互动内容的边界。视频不再是“做好了给你看”的东西,而是“你说了算”的东西。 PixVerse R1 作为第一个吃螃蟹的出现了,接下来看谁跟上。 如果你能实时控制视频里的一切,你第一个想玩什么?

宝玉

78,956 görüntüleme • 7 ay önce

视频生成模型的下一站,可能不是更长、更清晰的片子。 而是一个你能走进去,并亲手改变的世界。 过去两年,AI 视频已经能生成足够惊艳的画面。但无论视频多逼真,观众依然只能按下播放键: 镜头往哪里走,早已决定; 街角后面有什么,你无法靠近; 画面里出现什么,你也不能临时改变。 生成结束的那一刻,所有可能性也结束了。 Alaya Lab 刚刚开源的 AlayaWorld,试图把这件事反过来。 它不是先生成一段完整视频,再让你观看。 你可以用一张图片开启世界,推动摇杆改变镜头和移动方向;画面会随着操作继续生成。探索途中还能切换提示词,召唤火焰、凤凰、巨兽,或者让新的事件直接发生在当前场景里。 这意味着,AI 生成的内容第一次不只是“成片”,而开始接近一个可以进入、探索和影响的环境。 目前公开的几个核心指标: • 15B 参数 • 720p 分辨率 • 24 FPS 实时生成 • 支持 60 秒以上的连续探索 • 支持实时镜头控制与提示词切换 但真正困难的还不只是生成速度。 视频模型一旦连续运行,误差会逐帧累积:向前走了一段,再回头看,刚才的建筑可能已经变形;人物、道路和空间关系也会慢慢漂移。 这也是“生成视频”和“生成世界”的分水岭。 视频只要下一帧看起来合理。 世界却必须记得:东西在哪里、刚才发生过什么,以及你离开后再回来时,它是否还是原来的样子。 AlayaWorld 为此加入了两种互补的记忆: 一个显式 3D cache,用来保存空间位置; 一个压缩的帧历史,用来维持时间连续性。 再配合针对漂移历史的训练和 Error Bank,尽量阻止误差在长时间生成中不断放大。 所以这项工作的重点,不是“又一个画质更好的视频模型”。 而是把交互、空间记忆、长时稳定和实时生成,塞进同一个可以运行的系统里。 它现在当然还不是一款普通玩家打开电脑就能玩的游戏,也不能直接替代成熟的游戏引擎。 但它展示了一种很值得关注的方向: 未来的虚拟世界,未必需要把每栋建筑、每条道路和每个事件提前制作完成。 一部分世界,可能会在玩家移动和行动的同时,被模型实时生成出来。 这会影响的不只是游戏。 AI 原生玩法原型、影视预演、虚拟勘景、动态故事板,甚至机器人与智能体的训练环境,都可能从这种“可交互的生成世界”中长出来。 更难得的是,AlayaWorld 不只发布了 Demo。 模型权重与推理代码已经开放。你可以直接查看它如何处理实时交互、空间记忆和长时间生成,也可以下载权重进行研究与复现。 如果你正在关注世界模型、AI 游戏或交互式生成,这个项目值得拆一遍: Alaya Lab

知识猫图解

69,733 görüntüleme • 1 ay önce

Pixverse 发布 R1 实时视频世界模型 藏师傅也试了一下 前几天测试的 Pixverse R1 终于发布了,这是一个可以实时生成并且可以随时通过提示词介入修改后续内容的世界模型。 极限情况下可以实时生成 1080P 的高清视频,感觉成本再下来一点以后 AI 游戏和交互式的影视内容有戏了啊。 ------ 简单介绍一下使用体验,目前他们在一个单独的平台测试需要邀请码。 你可以选择预制的的三个主题进行体验,三个主题分别是巨龙巢穴、二战主题、海底世界,正式版本会增加到 6 个。 也可以创建自己的主题,选择画面比例、风格输入主题相关提示词就可以了。 生成之后主要的互动就是在他播放的过程中输入提示词来改变当前视频生成的剧情走向。 而且这里生成的视频居然还是带音乐、音效混合旁白的,比以前所谓的实时生成的模型强了不少。 ------ 算法和架构上主要的优化有: 这是个原生的多模态模型支持将文本、图像、视频、音频统一为连续的 Token 流,接受任何模态的输入。 PixVerse-R1 改成了非扩散的自回归架构,用来实现无限连续的生成,还使用了增加注意力机制,确保长时间生成的内容一致性。 为了适配实时视频生成的性能,他们将原来的迭代降噪逻辑进行了多项优化,他们叫瞬时响应引擎 (IRE),主要包括三个优化: Temporal Trajectory Folding:传统模型从噪点到清晰图像需要迭代几十步,他们直接暴力压缩到仅需 1–4 步。 Guidance Rectification:直接将传统的 CFG 逻辑蒸馏到了模型参数内部,节省了时间。 Adaptive Sparse Attention:生成高分辨率的视频的时候让模型学会学会“抓大放小”,自动识别重要区域进行精细计算,大幅降低计算负载。 ------- 目前由于成本问题需要邀请码才能测试,生成的分辨率是 480P,过几天会提高到 720P。

歸藏(guizang.ai)

16,373 görüntüleme • 7 ay önce

卧槽,其实我设想过这种场景:AI 不仅是生成图片、文本,还能动态生成软件界面,我以为这一天还挺遥远,倒是没想到 Google 最新的 Gemini 2.5 Flash-Lite 原型已经有实现了! 传统操作系统里的每一个按钮、窗口、菜单,都如同工程师提前雕琢好的石膏雕塑:精准但僵硬,功能完整却一成不变。但在Gemini 2.5 Flash-Lite的设想中,界面不再是预设的框架,而是实时生成的数字生命体。每次用户点击,都在即时重新塑造界面本身——一次次互动背后,流动的是生成模型敏捷而无形的计算。 想象一下,你的电脑不再是固定的“桌面+文件夹”组合,而是随每个动作实时“长出”的数字空间。当你打开记事本,键入“第三季度会议纪要”并保存时,模型瞬间理解你的动作与意图,下一刻界面便生成相应的文档,甚至根据上下文直接为你推荐接下来可能需要的操作。此时的操作系统,更像是与你实时对话的搭档,而非死板的命令执行者。 Google在构建这一前沿原型时,巧妙地提出了“UI宪法”和“交互对象”两个概念。前者为界面生成提供了基础的规则与审美框架;后者则实时捕获用户的每一次点击、输入甚至是更复杂的操作序列。这种设计,既保证了界面风格的稳定与统一,也赋予界面高度的情景适应性。 不过,让人真正感到惊艳的,还是这款原型系统的响应速度。传统的生成模型给人的印象往往是“大而慢”,而Gemini 2.5 Flash-Lite则通过即时流式渲染的方式,让界面在生成的同时就被逐步渲染、展示。这种渐进式生成,让人仿佛看着界面从虚空中逐步清晰,极大地提升了交互感。 然而,一个界面每次都重新生成,难道不会给用户带来混乱吗?Google也注意到了这个问题,并提出了一个巧妙的解决方案——“生成式UI图谱”。简单来说,系统会记忆用户访问过的界面,并在用户重新访问时,调用先前缓存的版本而非重新生成。这样一来,系统在新奇与熟悉之间找到了一种理想的平衡。 从概念走向现实的过程中,生成式UI潜在的应用场景也逐渐清晰。例如,当你在网上比价机票时,系统能实时生成一个小组件,一键对比或预订;又或者,当你调整日程安排时,日历应用能根据参会者情况即时提供最佳的替代方案——人和机器的交互过程变得更简短、更直接、更聪明。 事实上,生成式界面的出现可能不仅仅是一种技术革新,更是一种人机关系的重塑。我们正在从“机器为主、人类迁就”的时代,迈向“人类为主、机器顺应”的新时代。Gemini 2.5 Flash-Lite的探索也许只是个开始,却足以让我们思考:未来我们与计算机之间的界限,会模糊到什么程度?人与技术的共舞,又将如何改写我们的日常? 另外给我的一点感想就是:最大的改变不仅仅是人机交互,而是软件工程,如果软件也是生成式的,那么我们也想就可以完全跳过原来软件工程那些需求分析、系统设计、编码、测试的步骤了。

宝玉

74,753 görüntüleme • 11 ay önce