Загрузка видео...

Не удалось загрузить видео

На главную

兄弟们,AI 生成的视频,居然开始长出摇杆和技能键了。 一开始,屏幕里还是一个安静的山间小镇。蓝天、草坡、教堂,像刚进入游戏的新手村。 几秒后,红光从空中落下,地面被照亮,一团火球直接在路中央炸开,整条山谷瞬间烧成橙红色。 如果只看爆炸,这就是一段普通的 AI 特效视频。 真正值得看的是画面两边那两个摇杆。 AlayaWorld 展示的是一个边操作、边继续生成的世界。相机往哪里移动,它就往哪里补出新的画面;中途更换 Prompt,场景里还能继续发生新的事件。 普通视频模型给你一段成片。 世界模型得把你的下一步也接住:你去了哪里、刚才看见了什么、现在又触发了什么。任何一项断掉,这个世界都会立刻穿帮。 所以它真正难的不是多生成几秒,而是在你不断操作时,依然维持同一个世界。 先说清楚:我还没有在本地完整跑通,项目目前也偏研究用途。这段来自官方 Demo,不算实测。 但这 14 秒至少让一件事变得具体了: AI 生成的内容,开始不满足于被播放。它还想接住你的下一次操作。 Alaya Lab

34,855 просмотров • 2 месяцев назад •via X (Twitter)

Комментарии: 0

Нет доступных комментариев

Здесь появятся комментарии из оригинального поста

Похожие видео

生成视频已经满足不了人类的欲望了,生成世界才是未来!地球Online的虚拟世界版要来了。。。​ ​ 以前我们玩游戏都是一个固定好的世界,比如绝地求生、英雄联盟或者王者荣耀。。。但是我曾经还是畅想过在一个完全「未知」的世界升级打怪,不过从来没觉得这会变成现实,但是最近有一个词叫做「世界模型」非常火,我已经不止一次听说过它的名号。​ ​ 世界模型的定义是:一种能够学习并模拟环境状态变化的 AI 模型。 它能根据过去的观察和当前动作,预测:当前状态+动作→下一个状态。例如:汽车当前速度、道路情况、方向盘操作→汽车下一秒的位置和周围环境。​ ​ 也就是说如果置身「世界模型」之内,未来的每一刻都会根据你上一刻的行为而变化,这就很有意思了,如果大家都玩由「世界模型」支撑的游戏,那么每个人的游戏体验都会是独一无二的,这真的有可能颠覆现在的传统行业。​ ​ 之前更多停留在“听说”的阶段,但是 Alaya World 可能真的会让这个想法第一次变为现实,我在它的官网做了一个demo——选择魔法,整个世界为之变色👇。​ ​ Alaya World模型以 720p / 24 FPS 实时流式生成了可探索的世界。而且生成过程中可以自由移动来调整视角,通过提示词随时召唤魔法,并支持超过 1 分钟的稳定长时连续生成。​ ​ 但是除了“好玩”之外,「世界模型」肯定会比单纯生成视频更加烧钱,那为什么这些像Alaya Lab这种顶级实验室都在往里面疯狂砸钱。它到底能通过什么方式变现?我特意查了一下它的应用场景,不查不知道,一查吓一跳,「世界模型」真的是在下一盘大棋:​ ​ 1.帮机器人训练提效降本:在虚拟环境里模拟不同物体、房间和突发情况,让机器人反复练习抓取、行走和操作,不需要在现实中摆放物品,减少设备损坏的风险,从而降低训练成本。​ ​ 2.帮助自动驾驶测试危险场景:模拟行人突然出现、前车急刹、暴雨大雾等现实中很难主动制造的情况,让自动驾驶系统提前进行大量测试,提高安全性。​ ​ 3.帮助游戏和影视生成场景:生成可以移动和互动的虚拟空间,从而减少游戏地图、影视场景和3D内容的制作时间。​ ​ 4.帮助企业提前模拟现实决策。工厂、仓库或建筑公司可以先在虚拟环境中测试设备摆放、生产流程和人员路线,确认方案是否合理后,再在现实中实施,减少试错成本。​ ​ 所以对应的「世界模型」可以通过卖API和算力赚钱、通过软件订阅赚钱、通过企业定制赚钱,简单来说,现在AI视频模型能盈利的渠道它都有,而且甚至能够更广泛。​ ​ 我感觉我每一次赚钱都是抓住了风口,包括Youtube shorts的YPP、小红书虚拟AI产品、X AI自媒体,那下一个关于AI的机会在哪?我很看好「世界模型」,接下来我也会更加仔细研究这个赛道,希望在下一个十年不会下桌🫡​ ​ Alaya Word也已经开源: 相关技术论文感兴趣的朋友也可以去读一下(我是让AI解释的哈哈哈):

逸尘

20,391 просмотров • 2 месяцев назад

说个暴论,你的审美和品味就是你的提示词,并决定了你使用AI的上限。 咱们看看这个案例, 零游戏开发经验,两周时间, 一个人,做出了一个完整可玩的3D外卖配送游戏🆒 主角是一只戴粉色头盔的卡皮巴拉, 骑着电动车在城市里穿梭接单, 订单会真实堆叠在后座,掉了就会失败, 还有完整的手机App导航和超市捡货系统, 很多人看完第一反应都是AI太厉害了,但其实并不是是AI的胜利, 本质是人类品味的胜利, 他没写几行代码, 所有的逻辑模型贴图音乐音效, 全都是AI生成的, 他只做了3件事, 1️⃣告诉AI我想要一个卡皮巴拉送外卖的游戏, 2️⃣然后在AI生成的一万个版本里, 3️⃣选出那个看起来最好玩的, 最后花两周时间一点点打磨细节, 调参数摆道具改手感, 其实这就是现在大家说的vibe coding, 让AI接管了所有的执行层, 人类只需要负责方向和品味, 以前你得学会编程建模配乐剪辑, 才能做出一个游戏, 现在你只需要知道, 什么东西是好的, 很多人说这是作弊, 但这才是真正的创意民主化呀, 一年前需要一个小团队干几个月的活, 现在一个普通人两周就能搞定, 我相信未来会有无数这样的作品冒出来,创意会比技术重要一百倍甚至更多。 这也回答了那个很多人都在问的问题, AI时代人类到底还有什么用❓ AI确实能生成一切, 但它不知道的是 什么东西看起来舒服, 什么东西玩起来爽, 什么东西能让人会心一笑, 比如那些纯AI生成的游戏为什么不好玩, 因为它们只有技术,没有灵魂, 那什么是灵魂呢? 我理解灵魂就是那个站在AI背后, 做每一个微小选择的人, 就是那个知道什么时候该停手, 什么时候该再改一下的人, 而且我觉得这只是一个开始, 今天是浏览器3D游戏, 那明天可能就是完整的App, 后天甚至是3A级别的游戏原型, 我们正在见证一个全新的创作时代, 任何人都能把自己的脑洞, 变成真正的产品, 游戏链接放在评论区了, 直接浏览器打开就能玩, 建议大家去试试, 你会真切地感受到, 那个属于普通人的创作黄金时代, 真的已经来了! #AI #游戏开发 #vibecoding

阿绎 AYi

12,095 просмотров • 4 месяцев назад

用 Codex 加 ChatCut,我终于能用自然语言丝滑剪辑我的视频了! 最近一直在研究这个 ChatCut 的 CodeX 插件 他们在自然语言视频作这个层面,绝对是第一梯队 最牛逼的几个点在于: 1. 全自然语言操控 可以用自然语言操作整个剪辑过程 你不需要去手动操作复杂的剪辑轨道,只需要把你的需求用大白话讲给它,它就会自动去调用工具进行剪辑 2. 剪辑与生成无缝集成 它把视频剪辑和生成功能全部集成到了同一个工具里 如果你在剪辑过程中需要某些素材,它会自动帮你去找,或者直接生成对应的素材 整个体验非常顺畅,效果挺屌的 3. 优秀的可视化交互 这是目前我见过交互体验最好的自然语言剪辑工具 安装好之后,左边是你跟 Codex 对话的区域,右边就是它的整个工作区 你可以实时、可视化地看到 Codex 是如何操作你的视频素材进行剪辑的 更爽的是,你还可以直接在右边的工作区里,对刚刚剪辑的视频进行精细化的微调和修改 这种交互方式真的已经非常接近我理想中自然语言剪辑了 不过他们目前也确实存在一些问题, 比如整体的处理速度还是比较慢,以及 Token 的消耗比较大 这也是现阶段的一个局限性,但我觉得未来一定会越来越好 如果对自然语言视频制作感兴趣的兄弟们,一定要去试一下这个插件! 官网链接如下:

来碗牛肉粉

17,728 просмотров • 2 месяцев назад

说个所有AI创业者都不愿意承认的事实: 现在做一个AI工具的门槛已经降到了地板, 普通人做一个AI工具都只需要一天, 但学会用它干成一件事,却至少得一个月, 感觉像是AI时代的一个悖论😅 5.7M 阅读 23 万点赞的这条推,表面看是游戏圈在自嘲, 视频展示的是一颗树莓 237 万个高斯点,做一筐扔进游戏直接 2 FPS, 但如果把游戏开发四个字去掉,你会发现这是 2026 年所有 AI 工具用户的共同故事。 我先先把这个梗讲透: 原推作者 Dany Bittel 用 90 组焦点堆栈、每组 68 张照片,重建出来这颗树莓,总共 237 万个高斯点, 这是一种叫 3D Gaussian Splatting 的新型 AI 重建技术,简称 3DGS, 视觉效果有多吓人呢? 每一颗小果粒的绒毛、表面光泽、半透明的果肉质感全都纤毫毕现,在 RTX 3060 Ti 这种中端显卡上还能跑 100+ FPS,前提是只有这一颗🙃 Naz 的笑点在这里,老哥迫不及待想看哪个独立游戏开发者一激动,把一整筐这种树莓当道具扔进游戏里,然后纳闷为啥游戏跑 2 FPS🤣 我觉得这个吐槽之所以 5.7M 阅读,是因为它戳中了游戏圈的集体回忆—— Monster Hunter Wilds 一颗八角茴香用了 2048 乘 4096 的纹理直接卡帧,Cities Skylines 2 给行人建了高精度牙齿模型,全都是一个小道具毁全局的真实事故。 但这条推真正让我深入研究的还不是游戏开发的事,虽然我是个游戏爱好者,但对于游戏开发是个小白。 ayi干货输出开始! 咱们把游戏开发四个字去掉,这个故事正在所有 AI 工具领域都能同步上演, AI 生成的图,单张精美绝伦,但批量做长素材时质量瞬间崩溃, AI 生成的视频,10 秒钟惊艳,1 小时长片的管线一团乱, AI 生成的代码,单个函数完美,扔进项目跑起来一堆隐藏依赖, 共性是同一条规律: 新工具让做出来这件事的门槛降了 100 倍, 但用得动、跑得稳、能交付这件事的门槛反而升高了 10 倍。 过去做不出来是因为没人能做,现在做出来是因为工具太好用, 但优化、压缩、整合、降本的脏活累活没人帮你干,AI 工具时代真正稀缺的不再是创造力,而是生产工程能力。 所以我觉得这条树莓推真正的价值,不是教育游戏开发者怎么做 LOD, 是给所有正在被新工具喂得满嘴流油的人一个提醒: demo 级和生产级永远隔着一条河, AI 让前者变得免费, 后者还是要你自己游过去的!

AYi

2,991,659 просмотров • 4 месяцев назад

我尼玛,Claude Fable 5今天把整个软件行业的底层逻辑给击穿了! 以前做软件要几个月,现在只要15分钟,Claude Fable 5把产品经理和程序员的中间环节,直接干掉了。 也就是说,15分钟的销售电话打完, AI当场做出了客户要的可运行软件原型,喵个咪,这谁受得了啊🤯 Todd Saunders,Dalton Mills AI 的 CEO,做的是 trades 行业的垂直 SaaS——建筑、家政、暖通这些。 他用刚发布的 Claude Fable 5, 在跟一个客户的销售电话里, 让 AI 在后台实时转录通话, 同时自主构建客户刚刚提到的软件功能。 通话结束,他当场演示了一个完全可运行的原型,精确匹配客户 15 分钟前描述的需求。 一个语音报价系统:AI 实时听服务电话,自动匹配价目表,识别 upsell 机会,生成 Good/Better/Best 三档方案,自动发提案短信。整个过程近乎零人工干预。 不是 简单的AI 辅助开发,直接对话即构建,damn! 平复下激动的心情,这个案例最让我震惊的不只是AI 写代码快,AI 真的能听懂人话了啊啊啊, 然后一个长达几十年的产品开发范式,就这么被直接击穿了,holy sh*t! 想一想过去几十年我们怎么干活的,客户跟你说工人在现场太乱经常算错钱,你记下来,回去消化,以为懂了, 画原型,约评审,排期,开发,几周后拿出来, 客户摇头说不对不是这么回事, 你一肚子委屈,说我每个字都记了,他说你记的是我说的话,不是我脑子里的东西。 这个循环叫理解-翻译-验证,短则几周长则几个月,整个行业就吃这碗饭的,我们管它叫专业服务。 但是今天,Fable 5 把这个循环干掉了,不是压缩啊兄弟们,直接彻底干掉了, 客户说,AI 听,AI 当场做出来,客户当场看对不对, 没有 PRD,没有你在内部群里发那个需求我回去评估一下,没有一切中间件, 从客户嘴里说出来的那一刻,一个能跑的东西就在屏幕上等着他。 这才是真正要命的地方,这哪是提效啊,简直把整个底层逻辑都改变了。 但我们也必须立刻面对一个最尖锐的问题,就是那客户为什么还需要你?这不就 15 分钟的事吗? 这个问题必须正面面对,确实是客观存在的, 如果你对自己的定位只是把客户需求翻译成代码的那个人,那你完全可以被这 15 分钟取代,因为 AI 现在翻译得比你快,还不用开评审会。 但如果你做完项目就知道,原型和系统,中间隔着的不是几行代码,还有权限体系里那几十个你不知道为什么会存在的字段, 是客户二十年前的财务系统里藏着的那个没人敢动的数据表,是工人在负二层没信号的地方操作时该怎么缓存,也是某个老小区因为水压问题装不上你方案里那个完美的配件, 又或者是当地监管对报价条款里的某个措辞有特殊要求,这些东西,Fable 5 不知道,你问它它也不知道,它甚至不知道它不知道。 它的原型是乐高模型,系统是能住人的楼,之间的差距,专业术语叫工程判断,也可以叫领域责任,更可以叫为长期可用性兜底。 所以这个案例真正揭示的,不是谁会被替代,是什么在剧烈地变稀缺。 第一样,把 AI 的生成能力锚定在真实世界的复杂约束里, 这一下子就筛掉两种人:只会做原型不会做系统的人,和只会做系统但不懂行业的人。 留下的是那种,你问他这个需求能不能做,他会先问你那边现场平均信号几格、工人习惯左手拿手机还是右手、他们现在用的那个老系统数据库编码是 UTF-8 还是 GBK 的人。 第二样,领域知识, 我说的不是行业报告里那些漂亮话,是那些只有在这个行业干了十年才知道的脏东西。 AI 能生成完美的三档报价界面,但它不知道某个配件的供应商在雨季会涨价 30%,不知道某个话术在北方好使在南方会让客户挂电话,不知道这个工种的师傅脾气大你不能在流程里多加一步确认否则他宁愿不干,这些脏知识才是真正的护城河。 第三样,也是最被低估的一样:把原型变成可信赖系统的治理能力。 评估框架你怎么建,AI 改了这一处你怎么知道没把另一处改坏。 记忆持久化你怎么做,客户上次改的需求下次对话能不能记住。 错误恢复你怎么设计,流程跑到一半 AI 崩了用户看到什么。 多代理协作你怎么编排,一个 Agent 听电话提取意图,一个匹配价目表,一个检查合规,一个生成界面,人类在哪个节点介入裁决。 这些东西不酷,开会聊这些会让人想抽烟,但就是从酷到能用的最后那一公里。 Fable 5 和后续更强的模型,把生成这件事的成本和速度打到了一个新的量级。 这个量级意味着,做出一个看起来能用的东西,以后不再是任何人的竞争力。竞争的分水岭是,谁能把 AI 吐出来的东西,变成一个别人敢在上面跑业务、能长期依赖、出了问题找得到人负责的系统。 扯了这么多,最后一句话给大家共勉: 从今天起,把 80% 的精力,从怎么让 AI 生成得更快,转移到怎么为 AI 生成的东西负责,说白了,酷是给外人看的,稳是给我们自己续命的。

AYi

22,988 просмотров • 3 месяцев назад

很多人看 Inference Labs , 第一反应都是那些听起来特别硬的技术名词,比如什么 zkML,什么 PoI。 但说真的,如果你把这层技术的皮给剥开,你会发现它讲的根本不是代码,而是权力。 Inference Labs 真正做的,是把 AI 系统里以前那些模糊的权力关系,直接给拆散了摆在台面上。 在传统的 AI 世界里,模型方就是绝对的老大。 模型怎么跑,参数怎么调,最后给你一个结果,你除了相信,没有任何别的办法。 算力方也是一样,谁手里的机器多,谁的声音就大。这种结构下,用户其实是没有任何话语权的。 但 Inference Labs 正在把这套逻辑给彻底拆掉。 在它的 PoI 机制下,模型不再是那个不可挑战的上帝了。模型只能负责干活,负责给出推理结果,但它没有权利定义这个结果是不是对的。 一旦进了这个系统,模型的每一个输出都必须经过证明,经过别人的复现和验证。 这一步,本质上就是在削弱模型的权力。模型不再是权力的中心,它变成了一个纯粹的服务提供者。 再来看看算力。 很多人以为验证网络会让算力变得更值钱,更重要。其实恰恰相反,在 Inference Labs 的结构里,算力其实是被压制的。 算力在这里只负责执行任务,它不负责最后的裁决。你算得再快,机器堆得再多,你也改变不了结果的合法性。你没法靠着算力去强行说服系统接受一个错误的结果。 这意味着,算力在这里变成了一种商品化的成本,而不是一种能让你称王称霸的筹码。 那么,真正的权力流向哪儿了。 答案是验证者。 验证者不需要去训练什么顶级的模型,也不需要去买成千上万张显卡。 他们只做一件事,就是决定哪些推理是被系统承认的现实。这在现在的 AI 圈子里是非常罕见的设计。 它相当于承认了一点,AI 的问题其实不在于它聪不聪明,而在于当它给出结果的时候,谁有资格说这是一次有效的推理。 Inference Labs 把这个资格,从那些模型公司和平台手里,转移到了这个验证层。 这种变化的影响会非常深远。 以后在这个系统里,最强势的一方,不是那些最会训练模型的,也不是那些最有钱堆机器的。 而是那些能长期维持验证信誉的节点。这种节点看重的不是短期的那点博弈速度,而是长期的稳定性。 因为在它的规则里,只要你作恶一次,代价就是被系统永久边缘化。这种代价,任何想长久玩下去的人都承担不起。 所以我也一直在想,为什么 Inference Labs 在短期市场里显得这么安静。 其实道理很简单,这个系统里真正占便宜的角色,从来就不是那些会喊叙事,会搞投机的。 它奖励的是耐心,是持续不断的输出,以及永远不犯错的稳健。它天然地就在排斥那些只想进来薅一把就走的投机者。 我的感觉非常明确,Inference Labs 其实并不是在追求让 AI 变得更强,它是在尝试解决一个更有难度的问题。 那就是当 AI 已经足够强的时候,到底谁来约束它,谁来承担它产生后果后的责任。 在这个系统里,权力第一次不再是围绕着模型集中,而是被彻底拆散,被互相制衡。 这才是它最被低估的地方。 它在重新定义 AI 时代的规则。它告诉我们,在这个新的权力游戏里,诚实和稳定,才是最贵的资产。 #inference_labs #KAITO

比克大魔王

29,152 просмотров • 8 месяцев назад