Video yükleniyor...

Video Yüklenemedi

Ana Sayfaya Dön

给大家带来 Gemini-3.0-Pro-Preview 测试速报! 本次是使用 Cursor 泄露的 Gemini-3.0 进行测试的,所以仅当一个预览,等一会谷歌发布了后我会给大家带来正式测试。 直接说这个one-shot 测试结论:牛 好的地方:粒子效果非常牛逼,这个大象牙膏喷发的效果比之前的Kimi-K2-0905 还真实。而且三角烧瓶建模达到了GPT-5 的水平,这两项(粒子效果+物理建模)都是SOTA了。另外它甚至还给我增加了视锥剔除,超过画面的粒子不会渲染,保证了画面的流畅性, 这项加分。 不好的地方:成也剔除败也剔除,它将优化做到了极致,烧瓶内部的液体也用了背面剔除,结果导致在烧瓶外面看不到烧瓶内的液体,仅能通过瓶口看到。在我手动修复代码后,液体就正确显示了,不过液面并不贴合烧瓶内壁,这点还是 claude-sonnet-4.5 效果好 总结:牛,老铁牛,赶紧出啊,我等着测完了睡觉呢...我知道你大概是SOTA没跑了....

27,897 görüntüleme • 10 ay önce •via X (Twitter)

0 Yorum

Yorum bulunmuyor

Orijinal gönderinin yorumları burada görünecek

Benzer Videolar

GPT-5.2 实测! 美是真的美, 卡是真的卡 给大家带来 GPT 5.2 thinking 和 pro 的测试结果: 说实话, 这两个模型差距并不大, 但是价格却差了11倍. 大象牙膏测试, 这个感觉退步了, 甚至不如 GPT 5, 而且粒子效果还不如国产开放权重模型. 鞭炮连锁爆炸测试, 建模和光照, 粒子效果都非常好, 但追求画质的结果就是牺牲性能, 两个模型在测试中都非常的卡, 甚至 GPT 5.2 pro 尝试使用52个纹理, 而 WebGL 2.0 规范只支持16个. 所以不但会卡而且还报错. 陀飞轮机芯测试, 这个应该是目前的 SOTA, 齿轮效果, 光照, 建模准确性都不错. python 杯子倒水测试毫无进步, 跟 GPT5 没区别 总结, 新的模型还是更注重在美学上发力, web界面的风格很统一, 光影效果也是SOTA, 但是具体编程上没有看到特别大的进步, 尤其是 python. 另外, 这两个模型大概率都有 three.js 的包导入错误, 所以大型工程场景表现需要谨慎. 以及本次测试 gpt 5.2 thinking 每个测试运行6次取最好结果, 花了我3.88刀(就写了18个网页和6个python脚本), 而 gpt 5.2 pro 由于太贵了, 每个测试我只运行了一次, 就这样还花费了我7.12 刀(3个网页1个python脚本...). 所以推荐大家如果需要极致美学的场景, 可以考虑使用 gpt 5.2 thinking, 其他编程场景如果没有订阅, 还是谨慎, 毕竟太贵了. #GPT52 #GPT #OpenAI

karminski-牙医

31,685 görüntüleme • 10 ay önce

从国产SOTA走向世界SOTA? GLM-5.1 实测! 给大家带来 GLM-5.1 编程能力实测! 本次测试涵盖了前端, 后端, Agent 能力, 前端主要面向空间建模, 场景, 材质, 粒子效果等, 后端能力主要面向数据结构与算法, 体系结构, 性能优化, 内存和并发管理, 性能热点分析与调优, 面向编辑器方向的Agent能力(因为AI要自己改代码). 直接说结论, 本次测试前端方面粒子效果和光影鲜果略有提升, 剩下空间理解(甚至感觉下降了)和前端美学上没看到有什么提升, 只能说是提升了一点点. 但是后端性能上有巨大的提升, GLM-5.1 在我的 vector-db-bench 中直接秀了一手量化, 把原本32bit精度的数据量化到了8bit, 然后使用SIMD实现了一个指令周期内计算32个向量, 在我测试的其他模型中(包括Claude-opus-4.6, GPT-5.4-Pro(xhigh)) 都没有实现, 直接来到了榜首. 另外Agent能力上也有不小的提升, 同样是我写的让大模型模拟送外卖的硅基骑手测试, 其他大模型的优化还停留在看一个店能不能取两单上, GLM-5.1 已经优化到了我送餐的顺路还能再接一单, 并且仅用了大概GLM-5 1/4的 token 用量就超越了 GLM-5 的测试总分. 当然本次测试过程也很坎坷, 首先是我周末抢了2天都没抢到 coding plan (目前只有coding plan 能用这个模型), 我最后找智谱的同学给我开了个权限. 以及测试中发现白天API不是很稳定, 偶尔输出速度会掉到10tps, 以及会出现乱码文字(我的规避方法是让它输出英文, 然后再找个便宜模型翻译过来). 总结, 各位前端同学估计会失望, 因为无论是从工程还是页面效果上都看不到提升, 甚至可能会有点倒退, 但果写后端代码或者复杂Agent应用可以试试这个新模型, 会有很大的提升. #GLM51 #智谱 #GLM #AIAgent #大模型编程

karminski-牙医

19,683 görüntüleme • 6 ay önce

给大家带来小米 MiMo-v2.6-pro 的测试速报! 简单来讲, 这次不愧是直播RL带来的效果, AgenticCoding 能力提升明显, 之前的 MiMo-v2.5-Pro 在我的向量数据库测试中得分只有2505, 而这次直接翻了3倍, 得分来到了7810. 与 Claude Fable-5 分数接近了. 而且算法也进化为了单图HNSW分层近邻图(M=16/M0=28) + AVX-512精确距离 + 每线程visited stamp. 可以说只要再优化一下算法细节就是SOTA水平了. 而前端测试则是MiMo需要提升的重点了, 这次演示效果虽然有提升, 但是无奈横评的其他模型都太强大了, 而小米的加分项也是本身的算法Coding能力, 比如它是可以 one-shot 写出一个光追引擎的. 但是由于空间理解/物理模拟能力不到位, 小球没办法完成把墙壁撞破的演示. 另外本次还给大家测试了输出速度, MiMo-v2.6-pro-ultraspeed 版本可以达到464tps的速度, 着实恐怖. 而根据MiMo的技术报告, 峰值可以达到900tps, 常态化请求也可以稳定在500tps左右, 考虑到模型 1.02T 的总参数量, 以及高达 42B 的激活参数量, 再加上同等规模模型一般都在60-80tps的水平, 这个成绩相当亮眼. 当然也有值得注意的点, 比如这次测试我发现它还是有早停的问题的, 上面的向量数据库测试, 每轮最大迭代50次, 但是三次测试中, 有两次它迭代到30轮左右就没办法提升分数, 于是选择了直接交卷, 浪费了测试机会. 以及, 模型思考偏长, 而且暂时不支持调整思考强度, 加上普速接口现在异常火爆, 所以最好给大一些超时, 避免无法输出结果. 总结: MiMo-v2.6-Pro 适合搞后端AgenticCoding开发! 要算法有算法要质量有质量. 但是前端空间理解和美学还需要加强. 考虑到直播后训练的时候看到的67%的训练语料都是Coding, 这个结果丝毫不惊讶了. 希望下个版本前端能力也有提升! #mimo #mimov26 #mimov26pro #x小米mimo

karminski-牙医

12,850 görüntüleme • 19 gün önce