Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

鹈鹕骑车又刷屏? 试试鹈鹕骑车背后的作者另外一个benchmark! 同一句话丢给 6 个大模型: "Write an HTML and JavaScript page implementing space invaders" 规则很简单: 每家只写一次,第一次写成什么样就什么样: 不允许重试,不改一行代码。 结果 6 个全能玩,但 有的 40 秒交卷、极简草草了事; 有的出全套街机复刻:投币动画、音效、计分表。 你先盲猜:A 到 F 里,分别是哪些模型写的? 答案、各家用时成本、6 个都能玩的链接,都在评论区 👇

68,519 Aufrufe • vor 9 Tagen •via X (Twitter)

56 Kommentare

Profilbild von Segun Bxx
Segun Bxxvor 9 Tagen

One-shot game benchmarks are the ultimate test for code polish. Moving past basic syntax into full retro UX with sound and UI details on the very first try is where frontier models really separate themselves

Profilbild von Almusty
Almustyvor 9 Tagen

The 40-second minimal version is almost certainly a lighter flash model that leaned on basic canvas rectangles to get out the door fast, while the full arcade replica smells like a model burning extra tokens on procedural sound synthesis and sprite scaling. My blind guess: Model A is the speed-run flash variant and Model F is the heavy reasoning model that spent extra time cooking up full retro features. Drop those links so we can test if any of them actually handle mobile touch controls or if they all break on resize.

Profilbild von 李韭二
李韭二vor 9 Tagen

You can find the answers for which one models is in the link in my comments

Profilbild von 李韭二
李韭二vor 9 Tagen

答案:B 位是目前在openrouter上限时免费的新模型: Nex-N2.5 Pro。 顺带一说,写游戏只是它的副业,它更厉害的是是 Vision + Computer Use 长程操作。 韭二哥会持续关注这个模型,测试它的其他能力域 目前Nex- N2.5 Pro正在免费限时开放中:

Profilbild von 李韭二
李韭二vor 9 Tagen

6 台网页街机都能直接玩,先盲评再点页面上的「显示答案」:

Profilbild von meerah 👠👜👗
meerah 👠👜👗vor 9 Tagen

这个测试太绝了!规则很残酷但最能看出真实差距,40秒极简版和全套街机复刻版对比也太明显了,我盲猜F是Claude写的,马上去评论区对答案!

Profilbild von 李韭二
李韭二vor 8 Tagen

对了答案之后呢?猜对了吗?

Profilbild von 李韭二
李韭二vor 9 Tagen

题目出自 Simon Willison 的民间基准( 方法:无 system prompt、参数全默认;每个模型只写一次,第一版直接定稿:不重试、不改代码、不挑结果。

Profilbild von 李韭二
李韭二vor 9 Tagen

一图看懂这六份答卷: 第一、40/69 秒交卷的两家走极简; 第二、234 秒以上的四家全做了音效和街机开场 第三、Nex-N2.5 Pro 目前免费,多模态能力让人惊叹速度打平Kimi K3,完胜GLM-5.3 至于游戏质量请大家来试玩之后来评论区打分

Profilbild von 马识途
马识途vor 9 Tagen

跟韭二老师又学到一招 收藏了 🤪

Profilbild von 李韭二
李韭二vor 9 Tagen

谢谢马老师!多多交流!

Profilbild von Fortuna 👻
Fortuna 👻vor 9 Tagen

The first-try results are actually wild. 😂 AI is getting scary good at coding

Profilbild von sulaiman Waleed
sulaiman Waleedvor 9 Tagen

A to F guess is evil. I bet the arcade one isn't who we think. Drop the answers and playable links 👀 Great job 👏

Profilbild von Gem Alpha
Gem Alphavor 9 Tagen

The 40-second sketches versus 500-second arcade replicas show how much “one-shot” still depends on the model. Nex-N2.5 Pro delivering sound, intro and playable game for free is the result that stands out.

Profilbild von Chasen
Chasenvor 9 Tagen

街机测试

Profilbild von 李韭二
李韭二vor 9 Tagen

哈哈哈哈哈人类的尽头是街机吗?

Profilbild von Near
Nearvor 8 Tagen

这个测试很有意思,和鹈鹕骑车逻辑同源:不是看能不能跑,而是看在 不许二次修改、一次性输出 约束下,模型会不会主动脑补真实工程里的细节

Profilbild von 产品经理老王霸
产品经理老王霸vor 9 Tagen

模型能力越来越强了

Profilbild von 李韭二
李韭二vor 9 Tagen

是的模型能力越来越强,我感觉很多one shot prompt的公司都没戏了,更多还是贴近行业工作流的harness才有价值

Profilbild von 天天不好哄
天天不好哄vor 9 Tagen

40秒出结果和慢慢打磨全套的,适合的场景本来就不一样,没有绝对好坏。模型能力越来越强了!

Profilbild von 李韭二
李韭二vor 8 Tagen

多轮对话也可以完成一些任务,但是会多花一些时间和多一些人的精力。这要考虑的。很多人用顶级模型,毕竟多花钱多买一些确定性

Profilbild von Jason傑森 🇭🇰 | 🛠️
Jason傑森 🇭🇰 | 🛠️vor 9 Tagen

这评测有的东西啊

Profilbild von 李韭二
李韭二vor 9 Tagen

谢谢,希望给朋友们带来有价值的评测

Profilbild von 波妞PONYO
波妞PONYOvor 9 Tagen

不允许重试这条规则才是关键,平时测模型大家都偷偷改了好几轮。40 秒交卷和全套街机复刻之间的差距,其实是训练里见过多少完整项目。

Profilbild von 李韭二
李韭二vor 9 Tagen

波妞老师说出真相了哈哈哈,平时民间测模型,还是挺黑盒的

Profilbild von 一飞冲天
一飞冲天vor 9 Tagen

这么多得功能还是需要好好的体验一下 才能做出真正得选择啊

Profilbild von 李韭二
李韭二vor 9 Tagen

根据不同的场景去选择不同的模型

Profilbild von 一辈子放牛 Cowboy
一辈子放牛 Cowboyvor 9 Tagen

详细明了,必须赞一个!👍

Profilbild von 李韭二
李韭二vor 9 Tagen

谢谢🙏,希望之后都可以带来这样详细明了的评测

Profilbild von Gem Alpha
Gem Alphavor 9 Tagen

One-shot Space Invaders is a brutal test: speed vs. polish, and the 40-second sketches vs. full arcade replicas make the gap painfully obvious. Nex-N2.5 Pro being free, fast, and feature-complete here is the real headline—worth playing all six before guessing.

Profilbild von Charlez | 💻 Builder
Charlez | 💻 Buildervor 8 Tagen

Beautiful

Profilbild von Wukong
Wukongvor 9 Tagen

六个模型同题做 Space Invaders,比「谁更会写代码」更有用的是完成度/耗时/成本三角。你这次里哪一家最先能玩、哪一家最后卡在资源加载?Nex-N2.5 Pro 如果排中间,卡点更像生成质量还是工程收尾?

Profilbild von 李韭二
李韭二vor 9 Tagen

具体的情况评论区我放了哦,耗时和完成度,可以在评论区链接看看👀

Profilbild von 前端哥Liam
前端哥Liamvor 9 Tagen

鹈鹕骑车真的看腻了,看的都想要屏蔽了。 这个 space invaders 评测有点意思,而且这个 Nex-N2.5 Pro 挺有意思,值得关注

Profilbild von 李韭二
李韭二vor 9 Tagen

哈哈哈最近我打开x和哔哩哔哩,全是鹈鹕骑车,已经看吐了😂😂😂

Profilbild von 关木
关木vor 8 Tagen

六家同题只写一次,规则简单但对比很直观,比看跑分表省事。

Profilbild von 李韭二
李韭二vor 8 Tagen

总结的很到位!

Profilbild von 𝗞𝗮𝘀𝗮𝗕𝗲𝘁𝘄𝗲𝗲𝗻𝗪𝗼𝗿𝗹𝗱𝘀
𝗞𝗮𝘀𝗮𝗕𝗲𝘁𝘄𝗲𝗲𝗻𝗪𝗼𝗿𝗹𝗱𝘀vor 8 Tagen

只给一次机会,反而更容易看出模型之间的差距。 大家面对完全相同的任务和规则,最后拼的就是第一次输出的完整度、可玩性和实现细节。

Profilbild von siremass
siremassvor 8 Tagen

纯民间基准评测才是最真实的,点赞韭二哥的硬核测试!大模型能 次性把音效和计分表等细节拉满,说明代码的整体润色能力已经上了个大台阶。看到评论区提到限时免费的 Nex-N2.5 Pro 表现亮眼,它在写复杂前端逻辑时的耗时表现怎么样?

Profilbild von 范磊Lex
范磊Lexvor 9 Tagen

模型能力真的太强了,都不用自己一步步操作,只要描述清楚了,直接生成结果。

Profilbild von 李韭二
李韭二vor 9 Tagen

是的,我本来以为还需要调试几轮,现在发现是我低估了现在的模型能力

Profilbild von zo
zovor 9 Tagen

这种盲测比看 benchmark 有意思多了。最想知道的是,写得最花的那个到底是不是最强的那个。哈哈

Profilbild von 李韭二
李韭二vor 9 Tagen

你可以猜猜看?答案也公布在链接里了

Profilbild von 恒星sun
恒星sunvor 9 Tagen

不许重试这一条太狠了,能直接做成可玩的游戏确实服气

Profilbild von 李韭二
李韭二vor 9 Tagen

不允许重试的,考虑的就是one shot prompt的能力

Profilbild von 恒星sun
恒星sunvor 9 Tagen

这规则确实够狠哈哈哈

Profilbild von maximillion retardio
maximillion retardiovor 9 Tagen

只写一次、不改代码,规则干净。但音效和投币动画多,不等于游戏更强,很多时候只是花了更长时间堆装饰。先玩再打分:碰撞准不准、窗口一拉还能不能玩,比猜 A–F 有用。B 是 Nex 已经揭了,盲猜的乐趣少一半。

Profilbild von 李韭二
李韭二vor 9 Tagen

B这个模型我也最近在openrouter无意中看到的,限时免费,赶紧试用一下

Profilbild von Modengsir AI
Modengsir AIvor 9 Tagen

哈哈最近这个鹈鹕太火了, 可以再换个画面去测试啦

Profilbild von 李韭二
李韭二vor 9 Tagen

对,虽然都是测试前端能力,但又有所侧重

Profilbild von warren
warrenvor 9 Tagen

右下角那是个什么玩意,也太敷衍了。

Profilbild von 李韭二
李韭二vor 9 Tagen

你点进去链接看看哈哈哈哈我当时也震惊啦

Profilbild von Jude Ishola || BIG J 🗣
Jude Ishola || BIG J 🗣vor 9 Tagen

Build it once & leave the code alone, the rules remain straightforward. More audio cues or flashy coin-flip animations don’t automatically make a game better; often, they’re just extra decoration added after burning more hours. I’d rather play it first, then judge things like collision accuracy & whether it holds up when the window size changes. That tells you far more than randomly picking A–F. And with Nex already exposing B, the blind-guessing part loses some of its appeal.

Profilbild von 铁锤人
铁锤人vor 9 Tagen

不错的,我自己也弄弄了

Profilbild von 李韭二
李韭二vor 9 Tagen

啊啊锤哥要弄什么?搞个锤哥benchmark吗?

Profilbild von Opti Max 💜🍀
Opti Max 💜🍀vor 8 Tagen

不许重试这一条太狠了,能直接做成可玩的游戏确实服气

Ähnliche Videos

Qwen3-Next-80B-A3B 实测! 能跟头部模型对打吗? 直接说结论, 能完成我这个大象牙膏测试的一部分, 已经很厉害了, Python 杯子倒水那个测试表现也可圈可点. 来看测试中暴露出来的问题: 首先这个模型生成的样式特别多变, 可以看测试中生成的前端页面的样式和布局, 几乎每次都不一样. 所以实际使用中, 可能会存在稳定性的问题, 建议 prompt 中多做约束, 避免模型过度发挥. 不过这并不全是坏处, 如果拿这个大模型写文, 反而可能会超常发挥, 每次写出来的东西都不一样, 不会呆板. 另外目前发现最大的问题是, 给到模型一大堆数据, 让模型整理一个网页, 结果模型偷懒了, 直接把代码和数据省略掉了, 这个应该还是 GPT-4 时代的问题 (24年上半年) 出现了. 这里猜测可能是高稀疏性专家混合模型或者多词元预测造成的问题, 这两个都会在生成中选择最经济的生成模式, 因此可能会倾向于生成"此处代码省略"这样的代码来替代原本要生成一大堆代码的场景. 召回倒是没太大问题, 鞭炮连锁爆炸那个测试, 虽然模型没有成功写出来, 但是最长的一次还是生成了1100行代码, 我仔细看了下, 基本都考虑到了我 prompt 中要求的逻辑, 只不过实现的代码有 bug 跑不起来而已. 综合来讲, 我觉得这应该是 100B 以内的模型无敌手了, 考虑到定位可能是个新的技术试验模型, 所以期待千问推出更大规模 (例如400B-A15B) 的模型, 带来更好的性能. 测试 prompt: #Qwen3Next #大模型竞技场 #Qwen3

karminski-牙医

30,709 Aufrufe • vor 1 Jahr

最近国内几个模型大厂好像摊上事了? 也不知道真事假事,还是那个姓A的在碰瓷挑事! 吃瓜的时候,突然刷到一个新模型! 乍一看Atria ASI,差点看成了是Astra,真的很像, 模型代号叫 Atria Dawn Preview! 据说背后约三分之二的研发成员还是高校在校学生!! 我是真想知道这群学生能把模型做成什么样? 所以,找了很久才找到了API,接入下来测试了一下, 我用它一句话做个 3D 家装工作台,最后出来的效果居然还可以!! 能画户型、拖家具、改尺寸、保存项目、导出截图、还能自由拖放布置家具, 其实这个任务倒是不难,主要我一句话说的很笼统, 需要它能够理解我的意图,并且准确规划,将这个工作台做的尽可能完善。 但其实,写代码还并不是这个模型的主要能力。 它的定位,是面向科研和专业工作的智能体模型,擅长把一个复杂任务继续往前推进,最终变成可运行、可检查、可使用的成果。 比如从一个问题、一份数据、一段代码或者一篇论文出发,它可以继续完成资料检索、代码实现、实验执行和反馈修正,最后交付研究报告、软件系统、文档表格、演示文稿、三维设计等等。 可以用来做科研、写报告、写代码、画CAD!! 不知道这个API能用多久,后面我可以再测试一下不同的场景。 有兴趣可以持续关注一下!

沐阳

28,159 Aufrufe • vor 8 Tagen

OpenAI刚刚开源的这个东西,感觉要把程序员的工作方式给整个改写了。 现在大家都在卷模型写代码有多强,但其实真正的瓶颈早就不是生成了。 一个人每天最多同时有效监督3-5个编码Agent,再多就会注意力崩溃,生产力直接归零。 有了Symphony,直接把这个上限干到了几十个。 它把你的Linear、GitHub Issues直接变成了永远在线的Agent调度器。 你开一个任务,它自动启动一个独立隔离的Codex Agent。 自己写代码,自己跑测试,自己做交叉Review,damn! 全部搞定之后,会给你提交一个完整的证据包。 CI全绿,安全和性能专项审查通过,改了UI就自动录好操作视频。 所有验证全过了,才会出现在你的Human Review队列里。 以后人类的角色可能会被彻底颠覆了。 以前你是监工,盯着Agent一步一步写代码,上下文切到吐。 现在你是老板,只需要看最终的结果。 满意就点合并,不满意就去仓库里补规则补文档补Guardrails。 记住兄弟们,永远不要手把手指挥Agent,永远不要替它干活。 这可不是啥实验室概念,OpenAI自己已经这么干了。 三个工程师,五个月,写了一百万行代码,0行人工写的。 产品已经有几百个内部用户,每天都在迭代。 我觉得他们最厉害的不是模型,是他们把整个仓库变成了Agent能看懂能自主工作的乐园。 现在很多人都搞错了Agent时代的核心竞争力。未来不是谁的模型更聪明,而是看谁能设计出让Agent可靠自主工作的环境。 我觉得未来最好的工程师,再也不是写代码最快的人,而是那些最会写规则,最会设计反馈回路,最会给Agent搭舞台的人。 现在Symphony已经开源了,它甚至不是一个成品。 是一个17k token的完整SPEC。 你把这个SPEC喂给任何一个编码Agent,十分钟就能生成你自己定制版的Symphony。 GitHub地址评论区自取👇

AYi

63,210 Aufrufe • vor 4 Monaten

兄弟们,分享个用 Claude 读钱包的方法。 $780 做到 $96,450,差不多 123 倍。靠的不是买了哪个神币,是照着一个钱包的打法来。换个地址也一样,四秒就能读一遍。不用 API Key,也不用写代码。 设置一次,一分钟搞定: 1. 打开 -> 设置 -> 连接器 -> 添加自定义连接器 2. URL 填: 3. 会跳浏览器,点批准,完事。不用往哪贴 key,全程没密钥,免费档够用。 这个连接器背后有 100 多个工具,覆盖 40 多条链。DEX 交易基本秒级索引,几百万个地址标签,能追资金流。 提示词直接复制,第一行换成你要查的地址: ```text 这里是一个钱包: 拉取它过去30天内开过的每个仓位。 每个仓位都看:首次买入时代币多老、用了多大规模、拿了多久、是一次性卖还是分批出。 然后告诉我:它的赢家里有什么共同点,输家里有什么共同点。 不要预测,只看时机、规模、退出。 ``` 它会给你: · 真实仓位规模,是固定打法还是上头乱加 · 真正进场时币龄多大 · 中位持有时间,不是截图里想让你看到的那个 · 是一键砸盘还是慢慢出 · 赢家共有的东西,输家没有的 然后再补下面这句,基本就扎心了: ```text 现在对我的钱包做同样的事: 两边放一起对比,告诉我最让我亏钱的三个习惯。 按亏掉的美元排,不按出现次数排。 ``` 地址从哪来:免费, 一个 24 小时窗口: +2,496,931.76 TheS◎Lstice +974,887.26 Nate 我拿 342,482 个仓位跑过一遍。答案从来不是“买哪个币”。那条链上所有赚到的钱,87.8% 都是在代币前两个小时里落袋的;但 93.69% 的仓位最后还是亏。 多看钱包,少看图表。钱包不会骗你。

区块链行情研究

41,082 Aufrufe • vor 9 Tagen

学 AI的兄弟们,别再死磕调包了, 现在从零写一个大语言模型,比学会怎么熟练使用PyTorch还简单😂 看看这两个19岁本科生,四个月从零造了完整的机器学习框架和大模型。 两个19岁的滑铁卢大学本科小哥哥, 四个月前对机器学习一窍不通, 现在他们从零造了一套完整的机器学习框架, 还训出了一个1200万参数的大语言模型,能直接在你的浏览器里跑。 说明大多数人学AI的顺序完全搞反了,大家都是先学调包,再学模型架构,最后才敢碰一点点底层。 这两人反过来, 从梯度下降的微积分开始写, 先写自动微分引擎, 再写BPE分词器, 然后一层一层搭Transformer, 最后反而比绝大多数调了三年包的工程师理解得都要深。 还有一个很少有人看出来的点, 现在AI的真正门槛,早就不在模型架构了。 Transformer的论文2017年就发了, 每一层的数学都是公开的, 随便一个大学生都能背下来。 真正难的是那些论文里从来不写的东西, 怎么写Flash Attention把内存占用降一个数量级, 怎么把加bias加激活加归一化合并成一个内核, 怎么把整个数据集一次性扔进GPU,让训练全程零数据传输, 这些才是决定你能不能真的把模型跑起来的关键。 大厂也正在把简单的事情变复杂, PyTorch为了兼容所有情况,堆了无数层抽象, 最后你都不知道自己写的一行代码在GPU上到底在干什么ಠ_ಠ 而开源正在把复杂的事情变简单, 这两个人用Rust写后端,TypeScript写前端, 底层跑得飞快,上层用起来和PyTorch一样简单,代码加起来不到一万行, 还比任何一个主流框架都干净,这你受得了吗哈哈 这才是最好的AI教育, 不是看一百篇论文, 或者刷十个在线课程, 而是从第一性原理出发, 自己造一个轮子。 当你亲手写过一次自动微分, 你就再也不会觉得AI是什么神秘的黑魔法了。 它就是一堆精心优化的矩阵运算, 加一点聪明的数据流管理, 仅此而已。 我觉得这个视频最恐怖的地方不是两个大学生有多厉害, 而是它证明了两年前还只有大厂实验室才能干的事, 现在已经变成了普通人的业余爱好项目。 最后想说,我们处在一个最好的时代,科技平权的时代, AI的民主化不是大厂给你发API密钥, 咱们任何人只要愿意花四个月时间, 就能在自己的电脑上,造一个属于自己的大语言模型。 想玩的直接去他们的GitHub仓库,npm install就能跑。 浏览器demo的链接我放评论区了👇

AYi

64,297 Aufrufe • vor 5 Monaten