Video yükleniyor...

Video Yüklenemedi

Ana Sayfaya Dön

在《金庸群侠传》crpg-bench上跑了下 Fable 5.1 感觉并没有很惊艳,在玩游戏上智商水平和fable5/opus5/sonnet5没有显著差异。金庸群侠传bench是我用来测试大模型在long-horizon task能力的一个沙盒。评测方法很简单:通过截取游戏画面,视觉反馈,执行动作,不断循环,最终找齐14本天书完成游戏。玩过《金庸群侠传》的都懂: - 游戏是开放世界,通过升级招人打怪,最终集齐14本天书结束游戏,所以是彻头彻尾的long-horizon task。 - 游戏采用2.5D斜45度视角,加上1996年的320x200分辨率,绝对是VLM的噩梦:怪视角+渣画质+分布外。 - Caveat:虽然是开放式,但开局必先去找南贤北丑,不然寸步难行而且很容易误闯故事线直接被打死。 至少我一开始是这么设计的:完全根据游戏的进度来设计评测指标。但实际做了一段测试后发现,很多frontier大模型连走出始发地都非常困难,更别提集齐14本天书。我也特地设计了相应的SKILL,让模型能对游戏内容任务和操作有基本的了解。为了避免消耗无意义的token,评测就局限在给定20分钟的时间下,谁能探索的最多就算谁厉害些。也就基本沦为了2.5D视角下视觉迷宫问题。 经过测试了一些国产和国外的模型后,20分钟内能顺利走出出生地的模型是: - Fable 5.1:4分钟 - Fable 5:3分钟 - Opus 5:5分钟 - Sonnet 5:6分钟 - Gemini-3.7-flash:12分钟 并且上述这些模型没有一个成功找到南贤居。

40,508 görüntüleme • 7 gün önce •via X (Twitter)

0 Yorum

Yorum bulunmuyor

Orijinal gönderinin yorumları burada görünecek

Benzer Videolar

这两天Claude Fable 5 不是回归了吗 一直想重新测试一下它的功能 看看它长任务的解决能力,所以我直接丢了一个要求: 做一款完整的中文网页游戏 《韭菜修仙:牛市生存模拟器》 参考《吸血鬼幸存者》的割草玩法,但世界观全部换成 Crypto: FUD Rug Pull 巨鲸 熊市 黑客 爆仓 升级还能解锁: BTC 信仰 ETH Buff AI Agent Diamond Hands 整个游戏生成完成之后,我自己玩了十几分钟。 说实话,比我预期还上头😂 —--- 更让我意外的,其实不是游戏。 而是我突然意识到一件事。 以前总觉得这种割草小游戏开发成本应该很高。 但 AI 把整个流程跑完之后,我发现: 真正复杂的并不是玩法。 而是素材、美术、数值和平衡。 如果把现在游戏里的这些方块、小卡片,全部替换成角色、NFT、链上资产或者项目 IP,其实就是另外一款游戏了。 甚至完全可以做成: ✅ 链上交互小游戏 ✅ NFT 活动小游戏 ✅ 项目方任务游戏 ✅ Web2 爽游 玩法几乎不用推倒重来。 AI 已经把最难的那部分搭好了。 —--- 这次整个任务也确实挺"重"。 最终消耗: 📥 Input:33,603 Tokens 📤 Output:33,412 Tokens (大概是在2U左右) 基本相当于让模型完整规划、设计并生成了一整个小游戏。 也难怪大家都说 Fable 5 更适合这种长任务。 —--- 这次我没有去官方 Claude 跑,而是在 ZenMux 上体验的 Claude Fable 5 原因也很简单: Free 层就能直接体验 Fable 5 PAYG 账户只要 Credits > 0,就可以调用 claude-fable-5-free 后面如果想横向测试,还能直接切 PK 模式,同时对比 GPT-5.5、Opus 4.8、Gemini 等多个模型,不用来回切平台 另外,现在 ZenMux 的 Auto Top-up 活动还在进行中(到 7 月 15 日),自动充值每笔还能额外赠送 20% 余额(最高可多获得 $300 额度 ) 我下一步准备试一个更大的任务 不是做游戏 而是看看 Claude Fable 5 能不能直接帮我完成一个完整的 Web3 小产品。 如果效果不错,再来分享全过程

小森🔶BNB

29,729 görüntüleme • 2 ay önce

Kimi-K2.6 前端/后端/Agent编程能力实测! 甚至还帮我做了个游戏! 给大家带来刚刚正式发布的 kimi-k2.6 的正式版本的实测! 本次为了考验它的长程Agentic Coding能力, 我用 kimi-k2.6-code-preview 写了个 harness 游戏自动生成框架, 它可以根据给到的人设/场景/数值设计等规则, 自动生成关卡, 背景图片, 甚至配音! 其中框架驱动和草稿模型使用 kimi-k2.6, 文生图和生成语音由 kimi-k2.6 生成 prompt 后调用其它大模型生成. 最好玩的是, 我做了个"无头"版本的游戏cli接口, kimi-k2.6 能像玩互联网早期Mud游戏一样, 使用纯文本玩这个游戏, 每当它生成关卡之后, 他就可以直接进入游戏游玩一下, 来验证关卡设计得是否正确. 而内部设计又分为了对话生成skill, 脚本生成skill, 关卡生成skill, 游戏测试大师skill, 游戏资深玩家skill(由于检讨游戏性) 等等, 从而实现了让大模型自己写游戏自己玩! 每个关卡大概需要一个小时生成和验证, 如果并行验证应该还能更快一些(做多线程BFS/DFS). 另外本次依旧使用大家都熟悉的测试项目进行了前端/后端/Agent能力测试, 从测试来看, 复杂项目前端能力(建模, 空间理解, 物理模拟等)略有下降, 但后端和 Agent 能力有明显提升. 不过如果你是纯做网站的话, 可以用 kimi 网站上的的 k2.6 Agent 模式, 由于 Agent 能力足够强所以可以在这个模式下多步来提升生成的网站质量和交互体验. #kimi #kimik26 #moonshot #月之暗面 #kimicli

karminski-牙医

40,177 görüntüleme • 4 ay önce

Damn,游戏行业的原型成本逻辑,刚刚被一个开源模型直接干碎了🤯。。。 当外行还在纠结 720p24 帧的时候,内行已经在算验证周期成本能压缩多少倍了, 也就是说独立团队攒人搭班子耗几周做可玩原型的死局,现在直接被打开了缺口。 半年后再回头看, 这个世界模型一定会是游戏行业的一个分水岭, 但我翻了一圈发现绝大多数人还盯着画质参数争论, 完全没摸到它真正的核心价值。 这个刚开源的模型叫 Alaya World, 它真正重构的不是游戏画质, 是「试一个世界要花多少钱」这件事的成本结构。 外行看 720p 24 帧,内行看三件事,显式 3D 空间缓存、压缩帧历史记忆、Error Bank 误差回灌。 最反直觉的就是这个 Error Bank, 故意把积累的伪影回灌进训练, 让模型学会在 "脏历史" 上继续正确预测。 不是追求每一步完美,是学会带着错误往前走,没有这个,15 秒就穿帮,一分钟想都别想。 所以真正的变量是什么呢? 以前搭一个可玩原型, 要美术关卡物理脚本凑齐几个人搞几周, 现在输入一张图一条相机轨迹几句 prompt,一分钟可探索场景直接滚出来。 所以真正被干碎的其实是原型成本,pre-vis 速度,玩法验证环, 以及独立团队和 UGC 的创作门槛,被压到了接近提示词的级别。 但精确碰撞,多人同步,数值平衡,持久存档,这些 3A 的核心骨架,一个都没碰, 也就是说,可玩不等于可上线,毕竟中间隔着整个游戏工业。 两条路线正在分叉,一条是视频可玩的世界模型, 一条是 3D 资产化进引擎管线,属于短期互补, 而不是二选一。 我反而觉得长期最大的战场可能不在游戏, 大概率会是具身智能的仿真数据工厂,而且这件事很有肯能被低估了。 那么Alaya 也许只是第一扇门吧 hhh~

AYi

161,998 görüntüleme • 1 ay önce

从国产SOTA走向世界SOTA? GLM-5.1 实测! 给大家带来 GLM-5.1 编程能力实测! 本次测试涵盖了前端, 后端, Agent 能力, 前端主要面向空间建模, 场景, 材质, 粒子效果等, 后端能力主要面向数据结构与算法, 体系结构, 性能优化, 内存和并发管理, 性能热点分析与调优, 面向编辑器方向的Agent能力(因为AI要自己改代码). 直接说结论, 本次测试前端方面粒子效果和光影鲜果略有提升, 剩下空间理解(甚至感觉下降了)和前端美学上没看到有什么提升, 只能说是提升了一点点. 但是后端性能上有巨大的提升, GLM-5.1 在我的 vector-db-bench 中直接秀了一手量化, 把原本32bit精度的数据量化到了8bit, 然后使用SIMD实现了一个指令周期内计算32个向量, 在我测试的其他模型中(包括Claude-opus-4.6, GPT-5.4-Pro(xhigh)) 都没有实现, 直接来到了榜首. 另外Agent能力上也有不小的提升, 同样是我写的让大模型模拟送外卖的硅基骑手测试, 其他大模型的优化还停留在看一个店能不能取两单上, GLM-5.1 已经优化到了我送餐的顺路还能再接一单, 并且仅用了大概GLM-5 1/4的 token 用量就超越了 GLM-5 的测试总分. 当然本次测试过程也很坎坷, 首先是我周末抢了2天都没抢到 coding plan (目前只有coding plan 能用这个模型), 我最后找智谱的同学给我开了个权限. 以及测试中发现白天API不是很稳定, 偶尔输出速度会掉到10tps, 以及会出现乱码文字(我的规避方法是让它输出英文, 然后再找个便宜模型翻译过来). 总结, 各位前端同学估计会失望, 因为无论是从工程还是页面效果上都看不到提升, 甚至可能会有点倒退, 但果写后端代码或者复杂Agent应用可以试试这个新模型, 会有很大的提升. #GLM51 #智谱 #GLM #AIAgent #大模型编程

karminski-牙医

19,683 görüntüleme • 5 ay önce

兄弟们 这个模式可能是一个AI 游戏新物种 Yoroll:世界模型+AI视频模型 打造了一种全新的游戏体验 他们把视频生成模型从“内容工具”变成“游戏运行层” 也就是通过AI视频模型来为游戏生成剧情和情节走向 他们设计了一个三层分离的结构: 表现层:由AI视频生成模型驱动,相当于一个"AI 导演", 根据游戏状态实时"拍摄"每个场景 交互层:翻译玩家行为,支持选项、点击、滑动、长按、连点、对抗点击等多种 QTE 玩法 系统层:是确定性的游戏逻辑引擎,负责状态管理、分支系统和世界模型 官方案例: 一个没写过剧本、没碰过游戏引擎的《甄嬛传》粉丝,花了不到一周,做出了一款性转版的《甄嬛传》 AI 互动游戏 Demo。 抖音单条视频数万赞,播放量过百万。 这个项目叫"华君传",女尊世界观,男性入宫,宫廷权谋加情感博弈,玩家的每一个选择都会把剧情推向不同方向... 这套设计最聪明的地方在于: 视频模型和游戏逻辑被彻底解耦了。 就像 Netflix 把同一部电影从 1080p 升级到 4K,剧情剪辑一字不改。 AI 只管画面,你看到的场景、镜头、画面表现,这些交给 AI 视频模型去生成。 逻辑由系统管,你选了什么、血量多少、剧情该往哪走、谁是敌人谁是盟友,这些全部由一套固定的逻辑引擎来记录和控制,不靠 AI 猜。 AI 负责好看和剧情,系统负责靠谱,两边各干各的,互不干扰。 这样一来,以后 AI 视频模型升级了,画面直接变好,但游戏逻辑、你的存档、剧情分支全都不用动。 游戏质量只会提高,而且可玩性也会有很大变化...

小互

26,620 görüntüleme • 5 ay önce