正在加载视频...

视频加载失败

ControlNet 作者“敏神”再放大招:全新开源项目 FramePack,一套高效的视频生成框架。 13B 模型也能轻装上阵:生成 1 分钟、30fps 视频,显存最低仅 6GB;在 RTX 4090 上最高可达 1.5 秒/帧。 GitHub: 核心思路是“下一帧预测”的逐帧生成架构:从单张图片出发,也能延展出长达 1 分钟的连续动作与稳定叙事。 无论是人物舞蹈、动作演绎,还是场景推进与变化,都更容易实现可控生成。 同时已提供 Windows 一键安装包与可视化界面,上手快、操作直观。

52,785 次观看 • 3 个月前 •via X (Twitter)

0 条评论

暂无评论

原始帖子的评论将显示在这里

相关视频

视频生成模型的下一站,可能不是更长、更清晰的片子。 而是一个你能走进去,并亲手改变的世界。 过去两年,AI 视频已经能生成足够惊艳的画面。但无论视频多逼真,观众依然只能按下播放键: 镜头往哪里走,早已决定; 街角后面有什么,你无法靠近; 画面里出现什么,你也不能临时改变。 生成结束的那一刻,所有可能性也结束了。 Alaya Lab 刚刚开源的 AlayaWorld,试图把这件事反过来。 它不是先生成一段完整视频,再让你观看。 你可以用一张图片开启世界,推动摇杆改变镜头和移动方向;画面会随着操作继续生成。探索途中还能切换提示词,召唤火焰、凤凰、巨兽,或者让新的事件直接发生在当前场景里。 这意味着,AI 生成的内容第一次不只是“成片”,而开始接近一个可以进入、探索和影响的环境。 目前公开的几个核心指标: • 15B 参数 • 720p 分辨率 • 24 FPS 实时生成 • 支持 60 秒以上的连续探索 • 支持实时镜头控制与提示词切换 但真正困难的还不只是生成速度。 视频模型一旦连续运行,误差会逐帧累积:向前走了一段,再回头看,刚才的建筑可能已经变形;人物、道路和空间关系也会慢慢漂移。 这也是“生成视频”和“生成世界”的分水岭。 视频只要下一帧看起来合理。 世界却必须记得:东西在哪里、刚才发生过什么,以及你离开后再回来时,它是否还是原来的样子。 AlayaWorld 为此加入了两种互补的记忆: 一个显式 3D cache,用来保存空间位置; 一个压缩的帧历史,用来维持时间连续性。 再配合针对漂移历史的训练和 Error Bank,尽量阻止误差在长时间生成中不断放大。 所以这项工作的重点,不是“又一个画质更好的视频模型”。 而是把交互、空间记忆、长时稳定和实时生成,塞进同一个可以运行的系统里。 它现在当然还不是一款普通玩家打开电脑就能玩的游戏,也不能直接替代成熟的游戏引擎。 但它展示了一种很值得关注的方向: 未来的虚拟世界,未必需要把每栋建筑、每条道路和每个事件提前制作完成。 一部分世界,可能会在玩家移动和行动的同时,被模型实时生成出来。 这会影响的不只是游戏。 AI 原生玩法原型、影视预演、虚拟勘景、动态故事板,甚至机器人与智能体的训练环境,都可能从这种“可交互的生成世界”中长出来。 更难得的是,AlayaWorld 不只发布了 Demo。 模型权重与推理代码已经开放。你可以直接查看它如何处理实时交互、空间记忆和长时间生成,也可以下载权重进行研究与复现。 如果你正在关注世界模型、AI 游戏或交互式生成,这个项目值得拆一遍: Alaya Lab

知识猫AI实验室

70,424 次观看 • 1 个月前

#AI开源项目推荐:VisualStoryWriting 可视化故事创作:让你笔尖起舞,文思泉涌 想象一下,在你写作的同时,你笔下的世界就活生生地展现在眼前——时间线、世界地图、人物关系图……这一切都会被自动可视化。 更神奇的是,你对这些视觉元素的任何修改,都会立刻同步到你的故事文本中(比如,在地图上拖动一个角色,他在文中的位置也随之改变)。 这就是我们将要在 UIST2025 大会上分享的论文精髓。 我们开发了一款智能文字处理器,它能自动生成三种可视化视图:人物关系图、故事地图和场景时间线。这些视图能清晰地展示角色间的互动、他们在世界各地的足迹,以及故事场景的先后顺序,极大地帮助作者审阅和编辑自己的作品。 审视角色的移动轨迹,从此变成了一项直观的视觉任务。想改变一个角色在某个场景中的位置?太简单了,直接在地图上把他从一个地方拖到另一个地方就行。 调整故事场景的顺序,也只需要在时间轴上拖拽几下,就像整理幻灯片一样轻松。 想要创造一个新角色,或是让他们之间产生新的互动?同样简单,在关系图里新建一个节点,再连上一条线就搞定了。 我们邀请了经验丰富和初出茅庐的创作者们进行了两轮用户研究。结果发现,这些自动生成的可视化图表,能有效地帮助参与者规划故事的宏观修改、追踪故事元素,并探索情节的多种可能性,极大地激发了他们的创造力。 当然,能够帮助作者的可视化方式还有很多。因此,我们提出了一个设计框架,希望能启发未来更多样的可视化故事创作工具的设计。 我们的工作为未来的写作辅助工具奠定了基础——它不再仅仅依赖文字,更能借助视觉的

宝玉

35,626 次观看 • 1 年前