Video wird geladen...
Video konnte nicht geladen werden
鹈鹕骑车又刷屏? 试试鹈鹕骑车背后的作者另外一个benchmark! 同一句话丢给 6 个大模型: "Write an HTML and JavaScript page implementing space invaders" 规则很简单: 每家只写一次,第一次写成什么样就什么样: 不允许重试,不改一行代码。 结果 6 个全能玩,但 有的 40 秒交卷、极简草草了事; 有的出全套街机复刻:投币动画、音效、计分表。 你先盲猜:A 到 F 里,分别是哪些模型写的? 答案、各家用时成本、6 个都能玩的链接,都在评论区 👇
68,519 Aufrufe • vor 9 Tagen •via X (Twitter)
56 Kommentare

One-shot game benchmarks are the ultimate test for code polish. Moving past basic syntax into full retro UX with sound and UI details on the very first try is where frontier models really separate themselves

The 40-second minimal version is almost certainly a lighter flash model that leaned on basic canvas rectangles to get out the door fast, while the full arcade replica smells like a model burning extra tokens on procedural sound synthesis and sprite scaling. My blind guess: Model A is the speed-run flash variant and Model F is the heavy reasoning model that spent extra time cooking up full retro features. Drop those links so we can test if any of them actually handle mobile touch controls or if they all break on resize.

You can find the answers for which one models is in the link in my comments

答案:B 位是目前在openrouter上限时免费的新模型: Nex-N2.5 Pro。 顺带一说,写游戏只是它的副业,它更厉害的是是 Vision + Computer Use 长程操作。 韭二哥会持续关注这个模型,测试它的其他能力域 目前Nex- N2.5 Pro正在免费限时开放中:

6 台网页街机都能直接玩,先盲评再点页面上的「显示答案」:

这个测试太绝了!规则很残酷但最能看出真实差距,40秒极简版和全套街机复刻版对比也太明显了,我盲猜F是Claude写的,马上去评论区对答案!

对了答案之后呢?猜对了吗?

题目出自 Simon Willison 的民间基准( 方法:无 system prompt、参数全默认;每个模型只写一次,第一版直接定稿:不重试、不改代码、不挑结果。

一图看懂这六份答卷: 第一、40/69 秒交卷的两家走极简; 第二、234 秒以上的四家全做了音效和街机开场 第三、Nex-N2.5 Pro 目前免费,多模态能力让人惊叹速度打平Kimi K3,完胜GLM-5.3 至于游戏质量请大家来试玩之后来评论区打分

跟韭二老师又学到一招 收藏了 🤪

谢谢马老师!多多交流!

The first-try results are actually wild. 😂 AI is getting scary good at coding

A to F guess is evil. I bet the arcade one isn't who we think. Drop the answers and playable links 👀 Great job 👏

The 40-second sketches versus 500-second arcade replicas show how much “one-shot” still depends on the model. Nex-N2.5 Pro delivering sound, intro and playable game for free is the result that stands out.

街机测试

哈哈哈哈哈人类的尽头是街机吗?

这个测试很有意思,和鹈鹕骑车逻辑同源:不是看能不能跑,而是看在 不许二次修改、一次性输出 约束下,模型会不会主动脑补真实工程里的细节

模型能力越来越强了

是的模型能力越来越强,我感觉很多one shot prompt的公司都没戏了,更多还是贴近行业工作流的harness才有价值

40秒出结果和慢慢打磨全套的,适合的场景本来就不一样,没有绝对好坏。模型能力越来越强了!

多轮对话也可以完成一些任务,但是会多花一些时间和多一些人的精力。这要考虑的。很多人用顶级模型,毕竟多花钱多买一些确定性

这评测有的东西啊

谢谢,希望给朋友们带来有价值的评测

不允许重试这条规则才是关键,平时测模型大家都偷偷改了好几轮。40 秒交卷和全套街机复刻之间的差距,其实是训练里见过多少完整项目。

波妞老师说出真相了哈哈哈,平时民间测模型,还是挺黑盒的

这么多得功能还是需要好好的体验一下 才能做出真正得选择啊

根据不同的场景去选择不同的模型

详细明了,必须赞一个!👍

谢谢🙏,希望之后都可以带来这样详细明了的评测

One-shot Space Invaders is a brutal test: speed vs. polish, and the 40-second sketches vs. full arcade replicas make the gap painfully obvious. Nex-N2.5 Pro being free, fast, and feature-complete here is the real headline—worth playing all six before guessing.

Beautiful

六个模型同题做 Space Invaders,比「谁更会写代码」更有用的是完成度/耗时/成本三角。你这次里哪一家最先能玩、哪一家最后卡在资源加载?Nex-N2.5 Pro 如果排中间,卡点更像生成质量还是工程收尾?

具体的情况评论区我放了哦,耗时和完成度,可以在评论区链接看看👀

鹈鹕骑车真的看腻了,看的都想要屏蔽了。 这个 space invaders 评测有点意思,而且这个 Nex-N2.5 Pro 挺有意思,值得关注

哈哈哈最近我打开x和哔哩哔哩,全是鹈鹕骑车,已经看吐了😂😂😂

六家同题只写一次,规则简单但对比很直观,比看跑分表省事。

总结的很到位!

只给一次机会,反而更容易看出模型之间的差距。 大家面对完全相同的任务和规则,最后拼的就是第一次输出的完整度、可玩性和实现细节。

纯民间基准评测才是最真实的,点赞韭二哥的硬核测试!大模型能 次性把音效和计分表等细节拉满,说明代码的整体润色能力已经上了个大台阶。看到评论区提到限时免费的 Nex-N2.5 Pro 表现亮眼,它在写复杂前端逻辑时的耗时表现怎么样?

模型能力真的太强了,都不用自己一步步操作,只要描述清楚了,直接生成结果。

是的,我本来以为还需要调试几轮,现在发现是我低估了现在的模型能力

这种盲测比看 benchmark 有意思多了。最想知道的是,写得最花的那个到底是不是最强的那个。哈哈

你可以猜猜看?答案也公布在链接里了

不许重试这一条太狠了,能直接做成可玩的游戏确实服气

不允许重试的,考虑的就是one shot prompt的能力

这规则确实够狠哈哈哈

只写一次、不改代码,规则干净。但音效和投币动画多,不等于游戏更强,很多时候只是花了更长时间堆装饰。先玩再打分:碰撞准不准、窗口一拉还能不能玩,比猜 A–F 有用。B 是 Nex 已经揭了,盲猜的乐趣少一半。

B这个模型我也最近在openrouter无意中看到的,限时免费,赶紧试用一下

哈哈最近这个鹈鹕太火了, 可以再换个画面去测试啦

对,虽然都是测试前端能力,但又有所侧重

右下角那是个什么玩意,也太敷衍了。

你点进去链接看看哈哈哈哈我当时也震惊啦

Build it once & leave the code alone, the rules remain straightforward. More audio cues or flashy coin-flip animations don’t automatically make a game better; often, they’re just extra decoration added after burning more hours. I’d rather play it first, then judge things like collision accuracy & whether it holds up when the window size changes. That tells you far more than randomly picking A–F. And with Nex already exposing B, the blind-guessing part loses some of its appeal.

不错的,我自己也弄弄了

啊啊锤哥要弄什么?搞个锤哥benchmark吗?

不许重试这一条太狠了,能直接做成可玩的游戏确实服气
