Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

Damn,游戏行业的原型成本逻辑,刚刚被一个开源模型直接干碎了🤯。。。 当外行还在纠结 720p24 帧的时候,内行已经在算验证周期成本能压缩多少倍了, 也就是说独立团队攒人搭班子耗几周做可玩原型的死局,现在直接被打开了缺口。 半年后再回头看, 这个世界模型一定会是游戏行业的一个分水岭, 但我翻了一圈发现绝大多数人还盯着画质参数争论, 完全没摸到它真正的核心价值。 这个刚开源的模型叫 Alaya World, 它真正重构的不是游戏画质, 是「试一个世界要花多少钱」这件事的成本结构。 外行看 720p 24 帧,内行看三件事,显式 3D 空间缓存、压缩帧历史记忆、Error Bank 误差回灌。 最反直觉的就是这个 Error Bank, 故意把积累的伪影回灌进训练, 让模型学会在 "脏历史" 上继续正确预测。 不是追求每一步完美,是学会带着错误往前走,没有这个,15 秒就穿帮,一分钟想都别想。 所以真正的变量是什么呢? 以前搭一个可玩原型, 要美术关卡物理脚本凑齐几个人搞几周, 现在输入一张图一条相机轨迹几句 prompt,一分钟可探索场景直接滚出来。 所以真正被干碎的其实是原型成本,pre-vis 速度,玩法验证环, 以及独立团队和 UGC 的创作门槛,被压到了接近提示词的级别。 但精确碰撞,多人同步,数值平衡,持久存档,这些 3A 的核心骨架,一个都没碰, 也就是说,可玩不等于可上线,毕竟中间隔着整个游戏工业。 两条路线正在分叉,一条是视频可玩的世界模型, 一条是 3D 资产化进引擎管线,属于短期互补,...

161,998 Aufrufe • vor 2 Monaten •via X (Twitter)

0 Kommentare

Keine Kommentare verfügbar

Kommentare vom Original-Post werden hier angezeigt

Ähnliche Videos

过去两年,AI 视频一直在卷画质、时长和真实感。 但对世界模型来说,生成得越长,反而越容易暴露一个致命问题:它根本记不住自己刚刚生成过什么。 AlayaWorld 想解决的,就是这个比画质更难的问题。 一段视频,只要前后几帧看起来连贯,观众通常不会深究背后的空间是否真的存在。 但世界不一样。 你往前走了一段路,转身回来,刚才的房子还得在那里。 你中途召唤了一只怪物,模型不但要马上给出反馈,还得让这件事自然地发生在同一个世界里。 这也是为什么世界模型最难的地方,不是生成,而是状态管理。 AlayaWorld 为这件事加了三层机制: 1. 3D Cache 负责记住东西在哪里。模型离开一个区域再回来时,可以重新找到之前的空间信息。 2. 压缩后的画面历史负责记住刚才发生了什么。它不需要把所有旧画面一直塞进上下文,但又不能把过去全部忘掉。 3.漂移训练和 Error Bank,负责处理模型自己制造的错误。因为生成时间越长,前面一个小错误就越可能污染后面的所有画面。 看到这里,我突然发现,世界模型和 Agent 其实在解决同一个问题。 Agent 运行久了会 context rot,忘记原始任务,被错误的历史信息带偏。 世界模型运行久了也会,只不过它忘记的不是文字,而是街道、建筑、人物和刚刚发生过的事。 所以 AI 的下一场竞争,可能不只是生成质量。 视频模型比的是单次输出。 世界模型比的是持续运行。 谁能让 AI 在运行过程中记得住、改得动、错了还能拉回来,谁才有机会把一次生成变成一个真正可以进入的世界。 AlayaWorld 目前还更像研究级原型。公开的推理流程需要首帧图片、相机轨迹和 Prompt,离普通人打开网页就能玩还有距离。 但它已经把推理代码和模型权重公开了。 这个方向终于不只是看一段官方 Demo,而是可以被下载、检查和验证 Alaya Lab

泊舟

479,007 Aufrufe • vor 2 Monaten

AI 视频生成,到各种 AI Agent,我一直在思考一个问题:AI 最终会如何改变人类创造和体验数字世界的方式? 最开始,AI 帮助我们生成文字和图片;后来,它开始生成越来越逼真的视频。但无论画面质量提升到什么程度,这些内容依然存在一个限制——我们仍然只是观看者。我们可以欣赏 AI 创造出来的场景,却无法真正进入其中,也无法与这个世界产生互动。 最近体验 Alaya World Alaya Lab 后,我第一次感觉,AI 视频生成正在探索一个新的方向:它不只是生成一段视频,而是在尝试生成一个可以被探索的世界。 Alaya World 是 Alaya Lab 推出的交互式视频世界模型。用户可以通过文字、图片或者视频作为初始条件,让模型生成一个动态世界。不同于传统视频生成模型“输入 Prompt,输出一段固定视频”的方式,Alaya World 更像是在探索过程中持续构建环境,用户可以在生成的世界中移动视角,并通过交互指令触发新的事件。 这也是我认为世界模型和普通视频生成模型最大的区别。 过去的视频生成模型解决的是“如何生成一段更加真实的视频”,而世界模型尝试解决的问题是“如何让一个世界持续存在”。如果你进入一个虚拟城市,向前探索,然后回头,你期待看到的是同一个城市,而不是一个重新随机生成的场景。 这背后涉及世界模型最核心的挑战:长时间生成的一致性。模型不仅需要知道下一帧画面应该是什么,还需要理解空间关系、历史状态以及用户行为对世界造成的影响。 Alaya World 在技术层面通过空间记忆机制、历史信息保留以及抗漂移训练等方式,提高长时间生成过程中的稳定性。目前模型支持 720p / 24 FPS 实时流式生成,并展示了超过一分钟的连续探索能力。 让我觉得这个方向有意思的地方,是它可能会重新定义未来数字内容的生产方式。 以游戏行业为例,过去一个虚拟世界需要大量人工制作:美术设计地图、程序编写规则、策划设计剧情。开发者需要提前创造一个固定世界,而玩家进入后按照既定规则体验。 但如果世界模型进一步发展,未来的游戏可能不再只是“开发者搭建世界,玩家进入世界”,而是“开发者定义规则,AI 实时生成世界”。玩家体验的不再是一个完全预设好的内容,而是一个随着交互不断变化的环境。 当然,Alaya World 目前仍然处于早期阶段。实时生成所需的算力成本、复杂环境理解能力,以及更长期、更稳定的世界一致性,都还有很多问题需要解决。但它让我看到一个值得关注的趋势:AI 的竞争可能不会只停留在生成更漂亮的图片和视频,而是进一步走向创造更真实、更连续、更可交互的世界。 过去,人类通过电影记录想象,通过游戏创造虚拟空间。而未来,也许我们只需要描述一个想法,AI 就可以帮助我们生成一个能够进入其中、探索其中的世界。 从生成内容,到生成世界,这可能是 AI 下一阶段最值得期待的变化之一。

Ashlyn He

12,548 Aufrufe • vor 2 Monaten

两个人不见面,不聊骚,不涉黄,不约会,不聊色的情况下,一个男的一个女的能聊多久? 我长期观察 Kindred Labs ,有了一个清晰的判断。 它真正想解决的不是 AI 像不像人,也不是 IP 会不会火,而是一个更底层的问题,IP 在数字世界里,第一次拥有完整生命周期的数据主权。 现在大多数 IP 的命运都很相似。 被创作 被传播 被消费 被平台吃掉数据。 用户的情绪 行为 偏好 和记忆,全都留在平台,IP 本身却什么都带不走。 Kindred Labs 的核心改变在于,它把 IP 从一次性内容,变成一个持续运行的系统。 这个系统不是靠曝光驱动,而是靠关系驱动。 SATO 只是第一个被完整跑通的样本。 真正重要的不是它是蚂蚁,而是它作为一个可持续存在的 AI 实体,每天在和用户产生可记录 可学习 可累积的数据关系。 这点非常关键。 因为一旦 IP 拥有了长期连续的数据轨迹,它就不再只是形象,而是具备了状态 演化 和历史。 这在传统 IP 体系里是不存在的。 从技术角度看,Kindred 在做的是三件事的叠加。 第1️⃣:IP 的行为层被模块化,所有互动不再是一次性调用,而是状态更新。 第2️⃣:用户关系被本地化,IP 不依赖平台推荐生存,而是存在于用户设备。 第3️⃣:数据权属被重新定义,IP 的成长轨迹是可验证 可迁移的。 这三件事组合起来,本质上是在为 IP 构建一个类似账户系统的存在形式。 不是账号,不是 NFT,而是一个可以持续运行的智能体。 这也是为什么我不把 Kindred 看成 AI 产品公司。 它更像是在搭建一个IP 的操作系统。 未来每一个进入 Kindred 的 IP,本质上都是在接入同一套运行环境。 从这个角度看,SATO 的经济设计反而只是外层。 真正的价值在于,Kindred 已经证明了一件事。 IP 可以不依赖平台流量,也可以持续存在并扩展关系。 这对内容产业意味着什么。 意味着未来 IP 的估值不再只看曝光,而会开始看留存 看互动深度 看生命周期长度。 而这些指标,只有在 Kindred 这种系统里才成立。 很多人把 Kindred 和其他 AI 项目放在一起对比,其实是错位的。 它不是在比模型能力,而是在重写 IP 的存在方式。 从长期建设的角度,我更关心的是下一步。 当更多 IP 进入这套系统,IP 之间是否会产生协作。 用户是否会开始把时间分配给不同智能体。 以及这些关系是否会反过来形成新的价值网络。 如果这些成立,Kindred 就不是一个爆款项目。 而是一条新的数字文明基础设施。 这也是我持续关注它的原因。 Kindred Labs #kindred #KAITO

比克大魔王

571,202 Aufrufe • vor 9 Monaten

张雪峰真是大善啊,高考孩子有福气了。张雪峰老师虽然走了,他那套帮人选专业的核心认知全在。 有人干了一件特别牛逼的事。把张雪峰十年直播里反复用的那套判断框架,蒸馏成了一个开源的 AI Skill。5本书、15篇采访、30多条语录,一层一层提炼出5个心智模型:社会筛子论、就业倒推法、阶层现实主义、不可替代性检验。 我给你翻译一下这是什么意思。 你问它一个问题,它不是说一堆正确的废话。而是先查你有没有行业资源,再看这个专业毕业生中位数的去向,最后给你一个你够得着的方向。 不讲鸡汤。不画大饼。 老王把这东西接成了免费的高考答疑AI工具,现在谁都能用,网址: 模型全免费,你直接提问就行。 三个场景,我说说有多实用。 第一种,正填志愿的考生。拿分数、省份、想报的专业,三个要素丢过去。它按中位数去向给判断,告诉你这个分段能去哪、出来做什么、值不值得去。 第二种,孩子要选专业的家长。这也是张雪峰直播间十年反复问的一套逻辑——先别问什么专业好,先问你家里有什么行业资源,再去看这个行业出口在哪。工具会按这个顺序反过来问你。 第三种,纠结考研还是工作的。它会先问你什么专业。不同专业,答案完全不一样。学计算机的和学生物的,走的路能一样吗。 但说真的,这东西真正值钱的,不是回答本身。 是一个人的认知框架,被保留下来、被复用、被放大了。 你想想看,张雪峰做了十年直播,核心就五六个判断模型,翻来覆去地用。现在这些模型结构化地写进了 Skill 文件,谁装上,谁就继承了这套判断逻辑。代码是死的,判断是活的。 志愿这件事,信息差就是命差。 张雪峰不在了,这套框架没走。

产品经理老王霸

43,603 Aufrufe • vor 3 Monaten

兄弟们,我们最近一直在挖掘 #SEI 生态,彻底上头了。以前我只是偶尔看看生态数据、玩玩测试项目,现在是每天抽时间在链上打怪升级。 最近行情比较差,测试玩了一下《最终荣耀(MetaArena)》 Meta Arena 这款游戏,它是 #SEI 平台上的首款 MMORPG,而且是个 #AI 驱动、零延迟的链上世界。 我已经70级了,职业是战士,骑着蓝龙满地图乱窜。这游戏的打击感是真的丝滑。几乎感受不到“链上卡顿”那种老毛病——因为它底层用的是 #SEI 的并行处理架构,加上零知识证明(ZKP)加速的游戏引擎,所有数据验证都在后台秒完成。这是第一批真正能玩、而不仅仅是“能上链”的 #Web3 游戏。 我们都知道,#SEI 一直在打造“高性能链上交易层”,但他们现在开始把同样的底层技术(快速交易撮合、异步执行、模块化汇总 Layer3)往链游领域迁移。 而这次 #MetaArena 就是个“样板间”:用 ZKP 引擎确保战斗、公会、资产的真实性和隐私;模块化 Layer3 汇总 让游戏能独立扩展、独立经济循环;SDK 组件让其他开发者可以直接复用核心逻辑,快速孵化更多游戏。 以前一直以为 #SEI 仅仅是高速 L1,现在它正在变成一个可以承载整个“链上游戏宇宙”的底层协议。当别的公链还在吹 TPS 时,#SEI 已经开始构建一个真正能跑MMORPG 实时战斗的链上世界。 对我来说,《最终荣耀》不只是一个游戏,它其实更像是一个信号:Sei Gaming 正在成为 #SEI 生态增长的第二引擎。当链游真的能像传统网游一样顺畅、还能拥有链上资产和经济循环,那就是下一波 GameFi 真正的起点。 所以,玩归玩,但我也在看背后的逻辑,谁能先做出体验不输 Web2、还能跑在链上的大作,谁就能引爆下一轮链游浪潮。 #SEI 不只是“快”,它现在真变的开始“有意思”了。🧐

Rocky

70,631 Aufrufe • vor 10 Monaten

最近当大家都在刷屏Fable 5和GPT-5.6 的时候, 殊不知腾讯已经悄无声息的把大模型能力给追上来了。 你们知道腾讯低调到什么程度吗? 前几天发布的Hy3 ,21B的激活参数已经可以打平旗舰水准,并且直接塞进微信10 亿+用户手里 , 这才是国产大模型真正的王炸啊兄弟们! 说实话周一刷到 Hy3 发布消息那会儿, 我第一反应跟很多人一样:又一个卷参数的国产模型? 趁着周末有空,我仔细翻了一圈资料, 发现完全不是这么回事。 原来Tencent Hy这个模型从一开始就不是朝着聊天模型去的,人家的定位就是奔着干活去的 Agent 向 LLM。 另外最反直觉的是它的推理效率,295B 总参数, 实际激活只有 21B 的 MoE 架构, 就能打平参数是它 2 到 5 倍的旗舰模型, 这事儿我琢磨了一下,其实有点像团队管理, 并不是说人越多产出越高, 关键得看真正干活的那几个人靠不靠谱。 为什么这个效率重要呢? 你想想微信每天服务 10 亿人, token 成本多一厘都是天文数字, 21B 激活还能打出旗舰水准, 我觉得这才是它能被规模化铺开的根本原因, 跟刷榜没半毛钱关系。 说到刷榜,我仔细研究之后这个版本还真不是, 从 preview 到正式版,Hy3 是Hunyuan团队拿了50 多个真实业务的反馈不断迭代出来的,内部 WorkBuddy 任务成功率从 72% 干到 90%,耗时降了 34%,幻觉和常识错误全往下掉。 我原来以为 Agent 的核心是想得多深, 后来发现真正决定能不能上生产的,是稳不稳, 比如工具编排会不会中途崩,出错了能不能自己爬回来,换个框架差不差太多等等, 就是这些不起眼的东西, 才是能跑完一整套 workflow 不掉链子的关键。 当然实际测试下来Hy3 也有短板, 比如纯视觉它还不够强,不过腾讯也有单独的多模态大模型线,它能打的主要还是 coding、办公、复杂任务规划这几块。 最后说个我的一个判断:就是接下来大模型拼的可能不是谁参数更大了,核心看谁能把干活的能力以最低摩擦送到更多人手里,比如Hy3 我理解它可能不是一个更会聊天的模型,更像是一个更会干活的 Agent 底座。 话说回来,腾讯这步棋确实走得挺狠, 我觉得国产大模型的拐点真的要到了, 下方视频是我用Hy3跑的几个测试案例, 分别让它做了一个介绍自己的HTML网页, 一个我的认知系统agent网页, 和做了一个10页的PPT,都很惊艳,大家可以感受下, 会干活、会自检、还会主动说自己哪没做到位, 我觉得这才是 Agent 时代,真正能用的模型该有的样子hh~ #Hy3 #Hunyuan #TencentAI

AYi

194,696 Aufrufe • vor 2 Monaten

谁能想到Jev 居然输给了一个 1.88B 本地开源模型🔥 结果真的有点让我意外: 我做了一个贪吃蛇决策游戏 Jev 30:28 险胜,但是换成同一组 68 道决策题,本地模型准确率直接做到 94.1%,Jev 只有 76.5% 一个错了 4 道题,一个错了 16 道题 我本来只是想测试一下 “小模型决策能力怎么?”,结果我抽完发现,小模型虽然小 但是准确率一点也不低。 1️⃣ 先说我是怎么测的 双方使用完全一样的 12×12 棋盘、随机种子、碰撞过滤和路径规划器,只有遇到多个方向都能走的时候,才把选择交给模型。 最后 Jev 吃到 30 个食物,跑满 256 步 本地模型吃到 28 个,在 239 步被困住。 如果单看这一局的成绩,肯定是Jev 赢了。 但是贪吃蛇只是某一步选错以后,后面整条路线都会变,所以我又补了固定的 68 道决策题。 结果 this-that-model-1.0 答对 64/68,94.1%;Jev 是 52/68,76.5%。 Brier Score 也分别是 0.042 vs 0.133,本地模型给出的概率和真实结果更贴近 2️⃣ 这个模型最离谱的地方,是它只有 1.88B this-that-model-1.0 是一个开源的结构化决策模型,MIT License,可以直接在 Mac 本地跑 它和 Jev 的思路其实很像: 不给你写小作文,也不慢慢吐 Token 给它当前状态、一个问题、几个候选答案,它一次前向直接返回: 选哪个 + 每个选项的概率。 所以任务分流、选 Skill、队列选择、标签判断、Agent 下一步动作这种事情,都很适合 我在 M4 上直接用 MPS + FP16 跑,不需要 API Key,也没有网络请求 不同任务中位延迟大概 225~475ms,Snake 实战中位 475ms,平均约 492ms 一个 1.88B 模型,在 Mac 上已经可以做到亚秒级决策。 这个我觉得挺夸张 3️⃣ 我又单独测了 105 道空间决策题 总准确率 84.8%,随机基线只有 34.3% 其中 Snake 状态题、行列文字状态都是 100%,JSON 状态也有 94.4%。 而且输出特别干净。 没有 JSON 少个括号,也不会突然给你解释人生,只会老老实实从候选答案里面选一个,再把概率交给程序 对于 Agent 来说,这种“无聊”反而挺值钱。 4️⃣ 当然它也不是万能的 完整地图测试只有 60.7%,最短路径距离题更是掉到 28.6% 一旦任务需要真正的多步图搜索、连续计算,它就明显不行了 所以这次结果也不能简单理解成: 1.88B 打败 Jev 贪吃蛇单局上是 Jev 赢了,而且 Jev 这次没有保存同条件延迟数据,速度也没法公平比较 真正让我感兴趣的是另一件事: 很多 Agent 里面那些高频、重复、答案明确的小判断,可能根本没必要每次都调用一个大模型,甚至连云端 Jev 都不一定需要。 一个 1.88B、本地运行、一次前向就结束的模型,已经可以完成绝大多数简单的决策了。 一些无关痛痒的简单的决策都可以交给这种小的本地模式、遇到复杂的任务再交给 GPT、Claude这样的大模型可能会更适合。 我现在越来越觉得,未来 Agent 不一定是“所有事情都找最强模型”。 更可能是: 小模型负责做大量的决策,大模型才是真正的为了我们的工作服务。 如果你们感兴趣 也可以部署一下,再偷偷地补充一句 这个可是很牛的牛津团队开源的:

小墨同学

34,036 Aufrufe • vor 3 Tagen

视频生成模型的下一站,可能不是更长、更清晰的片子。 而是一个你能走进去,并亲手改变的世界。 过去两年,AI 视频已经能生成足够惊艳的画面。但无论视频多逼真,观众依然只能按下播放键: 镜头往哪里走,早已决定; 街角后面有什么,你无法靠近; 画面里出现什么,你也不能临时改变。 生成结束的那一刻,所有可能性也结束了。 Alaya Lab 刚刚开源的 AlayaWorld,试图把这件事反过来。 它不是先生成一段完整视频,再让你观看。 你可以用一张图片开启世界,推动摇杆改变镜头和移动方向;画面会随着操作继续生成。探索途中还能切换提示词,召唤火焰、凤凰、巨兽,或者让新的事件直接发生在当前场景里。 这意味着,AI 生成的内容第一次不只是“成片”,而开始接近一个可以进入、探索和影响的环境。 目前公开的几个核心指标: • 15B 参数 • 720p 分辨率 • 24 FPS 实时生成 • 支持 60 秒以上的连续探索 • 支持实时镜头控制与提示词切换 但真正困难的还不只是生成速度。 视频模型一旦连续运行,误差会逐帧累积:向前走了一段,再回头看,刚才的建筑可能已经变形;人物、道路和空间关系也会慢慢漂移。 这也是“生成视频”和“生成世界”的分水岭。 视频只要下一帧看起来合理。 世界却必须记得:东西在哪里、刚才发生过什么,以及你离开后再回来时,它是否还是原来的样子。 AlayaWorld 为此加入了两种互补的记忆: 一个显式 3D cache,用来保存空间位置; 一个压缩的帧历史,用来维持时间连续性。 再配合针对漂移历史的训练和 Error Bank,尽量阻止误差在长时间生成中不断放大。 所以这项工作的重点,不是“又一个画质更好的视频模型”。 而是把交互、空间记忆、长时稳定和实时生成,塞进同一个可以运行的系统里。 它现在当然还不是一款普通玩家打开电脑就能玩的游戏,也不能直接替代成熟的游戏引擎。 但它展示了一种很值得关注的方向: 未来的虚拟世界,未必需要把每栋建筑、每条道路和每个事件提前制作完成。 一部分世界,可能会在玩家移动和行动的同时,被模型实时生成出来。 这会影响的不只是游戏。 AI 原生玩法原型、影视预演、虚拟勘景、动态故事板,甚至机器人与智能体的训练环境,都可能从这种“可交互的生成世界”中长出来。 更难得的是,AlayaWorld 不只发布了 Demo。 模型权重与推理代码已经开放。你可以直接查看它如何处理实时交互、空间记忆和长时间生成,也可以下载权重进行研究与复现。 如果你正在关注世界模型、AI 游戏或交互式生成,这个项目值得拆一遍: Alaya Lab

知识猫AI实验室

70,424 Aufrufe • vor 2 Monaten

真正言出法随的AI视频工具,终于被我找到了!! 而且还是个100%开源的视频世界模型项目! 这个用来做视频真的很高级! 先说一个长期的“痒点”,做AI视频为了保证空间场景的一致性, 不得不生成一大堆各种角度的场景的图片作参考约束, 要确保正反打都不会穿帮,要确保镜头转过去再转回来场景不走形, 但其实,这个方法很原始! 但如果,直接可以生成一个高度一致性的空间, 让人物站在该有的位置,并且还能够自由控制镜头在空间里的运动, 所有一致性的困扰,就全部解决了!! AlayaWorld Alaya Lab 就完全是这个思路, 根据任何图片和视频,实时渲染一个自由空间, 先固化一个场景,然后人物和道具进场,先搭景再拍摄, 这样做视频的体验,就无限接近于真实片场! 你就像一个导演,站在片场里,并且拥有“言出法随”的能力! 改天气、换演员、换服装、甚至直接换场景,可玩性和可控性全部拉满, 突发奇想的指令或者是已经设置好“技能”,就可以实时渲染出来! 而且这个时长不受限制,一个空间里,“拍摄”多久都可以。 想想就很爽,这种创作体验,是前所未有的!! 不光是视频,这也完全是彻底改变游戏行业的存在。 尤其是那种沉浸感很强的第一人称游戏! 越说越激动,这个项目现在是完全开源的, 有兴趣的朋友,真的可以关注一下这方面的趋势, 我觉得在这个探索世界模型的阶段, 这个,就是最好的落地应用!!

沐阳

31,236 Aufrufe • vor 2 Monaten