Video yükleniyor...

Video Yüklenemedi

Ana Sayfaya Dön

Advanced Frontier LLM Coding Benchmark 13.08.2026 Modeller: - Grok 4.6 Extra High - Cursor - Opus 5 Max - Claude Code (App) - Qwen 3.8 Max - Qwen-Code (CLI) - Kimi K3 Max - Kimi-Code (App) - GLM 5.2 Max - Zcode (App) - GPT 5.6 Sol Very High...

12,564 görüntüleme • 15 gün önce •via X (Twitter)

0 Yorum

Yorum bulunmuyor

Orijinal gönderinin yorumları burada görünecek

Benzer Videolar

Dostlar yeni LLM Coding Benchmark çıktılarımız hazır. 🎉 Bu kez yine zorlu alanları bir araya getiren Trail ile Çift sarkaç: Euler vs RK4 entegrasyonu task'ını test ettim.Bu task ile modellerin hibrit; algoritma, matematik, coding ve Frontend yeteneklerini ölçümledim. Tüm modelleri opencode kullanarak kodlama yaptırdım. Aynı zamanda hepsinde en üst thinking eforu kullandım. Bu kez skorlamada Fiyat/Performans ve Kalite/Performans skalasında yaptım. Değerlendirmeyi modellerin isimlerini görmeden GPT 5.6 Pro yaptı. Testte yer alan Modeller; - DeepSeek V4 Flash 0731 - Gemini 3.6 Flash - Grok 4.5 - Sonnet 5 - GPT5.6-Luna - GPT5.6-Sol - Opus 5 - Kimi K3 - Qwen 3.8 Kalite/Performans - Genel sıralama - Opus 5 — 96.32/100 - $1.4660 - GPT5.6-Sol — 93.85/100 - $0.3627 - GPT5.6-Luna — 92.15/100 - $0.2373 - Kimi K3 — 91.70/100 - $0.3312 - Qwen3.8 — 89.95/100 - $0.2807 - Sonnet 5 — 88.16/100 - $0.4429 - DeepSeek V4 Flash 0731 — 85.12/100 - $0.0994 - Gemini 3.6 Flash — 83.24/100 - $0.0637 - Grok 4.5 — 79.82/100 - $0.4768 Fiyat/performans - Genel sıralama - DeepSeek V4 Flash - 88.00 - GPT5.6-Luna - 87.04 - Qwen 3.8 - 85.75 - Kimi K3 - 84.91 - Gemini 3.6 Flash - 83.57 - GPT5.6-Sol - 82.91 - Grok 4.5 - 81.87 - Sonnet 5 - 80.66 - Opus 5 - 80.22 Genel Değerlendirme: - Prod fiyat/performans kazananı: Qwen3.8. - Maksimum kalite, maliyet önemsiz: Opus 5. - En düşük bütçede yeterli ve tam özellikli çıktı: DeepSeek V4 Flash - En dengeli orta nokta: GPT5.6-Luna ve Kimi K3 Teknik Alan Spesifik Başarı: - En iyi saf numerical integrator: Opus 5 = GPT5.6-Sol - En doğru built-in validator: GPT5.6-Luna - En iyi standart runtime performansı: DeepSeek V4 Flash ve Kimi K3 - En iyi görsel kalite: Opus 5 - En iyi UI/ürün: GPT5.6-Sol - En iyi mimari: Opus 5 - En iyi ekonomik F/P: DeepSeek V4 Flash - En iyi production F/P: GPT5.6-Sol - En pahalı marjinal kalite artışı: Opus 5 - En ciddi validator hatası: Grok 4.5 - En yüksek hot-path/GC riski: Gemini 3.6 Flash

Alican Kiraz

14,814 görüntüleme • 26 gün önce

Coding Benchmark 🔥 GPT 5.6 Sol Max vs Fable 5 Max vs GLM 5.2 Max vs Opus 4.8 Max - Part 1 Task: Stable Fluids (Jos Stam) - Modelden tek bir bağımsız HTML dosyasında, Jos Stam'ın Stable Fluids yöntemine dayalı gerçek zamanlı, etkileşimli bir akışkan simülasyonu üretmesi isteniyor — kütüphane yok, zero-shot, tek deneme. Çıktı; semi-Lagrangian advection, iteratif difüzyon ve basınç projeksiyonu adımlarını doğru sırada içermeli, ImageData ile 256×256 gridde akıcı çalışmalı, fareyle boya ve hız enjekte edilebilmeli, ekranda divergence ile kütle korunumunu canlı raporlamalıdır. Final Puantaj ve Özet •GPT 5.6 Sol Max — 91/100 •GLM 5.2 Max — 88/100 •Opus 4.8 Max — 86/100 •Fable 5 Max — 81/100 Maliyetler: - GPT‑5.6 Sol : $54,05–$97,02 - Claude Fable 5 : $78,75 - Claude Opus 4.8 : $15,52 - GLM‑5.2 : $1,17 Neden önemli: Bu benchmark, "çalışıyor gibi görünen ama sessizce yanlış" kodu yakalayan nadir testlerden. Basınç projeksiyonunu atlayan bir model yine hatasız çalışan, boyayı yayan bir animasyon üretir — ama girdap oluşmaz; yani hata derleme değil, fizik seviyesindedir ve ancak çıktıya bakınca anlaşılır. Aynı şekilde, Stam'ın yönteminin tanımlayıcı özelliği koşulsuz kararlılıktır: timestep'i sonuna kadar açtığında doğru implementasyon ayakta kalır, naive ileri fark şeması anında NaN'a düşer. Modelde neyi test eder: Ezberlenmiş kod parçacığı yerine algoritmanın nedenini kavradığını (projeksiyon adımının niye zorunlu olduğunu), sayısal yöntem seçimini (implicit çözücü, geri-izleme, yeterli Poisson iterasyonu), gerçek zamanlı grafik farkındalığını (tek blit vs hücre başına fillRect), ve uzun kodda tutarlılığı — sınır koşulları, alan yönetimi, UI durum yönetimi tek dosyada bozulmadan bir arada duruyor mu. Üstelik değerlendirme sübjektif değil: divergence sıfıra iniyor mu, silindirin arkasında Kármán girdap sokağı beliriyor mu, büyük dt'de hayatta kalıyor mu — üçü de ikili (evet/hayır) sonuç verir, yani "vibecoding" testine nadir bulunan nesnel bir skorlama tabanı sağlar.

Alican Kiraz

40,899 görüntüleme • 1 ay önce

Dostlar sizleri çok şaşırtacak bir benchmark hazırladım. Bu benchmark'da Qwen3.6-35B ile Kimi-K3 2.8T modelini kıyasladım. Biliyorum çok ütopik bir karşılaşma olarak gelebilir size. Ama inanın doğru loop döngüleri ve iterasyonlarla bu iki modelin birbirine nasıl yaklaştığını görünce çok şaşıracaksınız. Bu test sonuçları aslında bize şunu da gösteriyor; alan spesifik doğru model finetuning'leri ve agent yapıları ile bir oyuncu GPU'sunda çalıştırdığınız bir LLM modelinin, Datacenter seviyesindeki bir altyapıda inference edilen bir model ile nasıl yarışabileceğini bize anlatıyor. Kısaca teki bir RTX 5090 32GB'de çalışırken diğeri 3x (8x Nvidia B200 192GB)'de inference edilebiliyor. Bu nedenle Ilya Sutskever'ın da podcast'lerinde bahsettiği gibi artık zaman Araştırma ve Keşif Çağı, Scaling değil... Coding Benchmark: Qwen3.6-35B vs Kimi-K3 High - Judge: ChatGPT 5.6 Pro - Agent: Opencode - Task: Çift sarkaç + iz (trail), Euler vs RK4 entegrasyon farkı burada görünür — kötü modelde sarkaç enerji kazanıp savrulur. Kaos davranışı görsel olarak tatmin edici. Modellerde İterasyon Sayısı ve Cost Miktarı: - Kimi-K3: 3 adet iterasyon - $0.59 cost - Qwen3.6-35B: 8 adet iterasyon - $0.09 cost Final Puantaj ve Özet - Kimi K3 - high — 90,6/100 - Qwen3.6-35B — 71,6/100 Kimi; fizik mimarisi, chaos görselliği, trail doğruluğu, uzun süreli performans ve düşük risk açısından açık biçimde önde. Qwen; daha geniş bir kontrol paneli, fullscreen, screenshot, preset ve ayarlanabilir chaos sayısı sunuyor. Ancak bunların önemli bölümü task’ın core kalitesini yükseltmiyor; hidden ×10 single-mode maliyeti, frame-dependent timestep, ters trail fade’i ve ölü Fade kontrolü toplam kaliteyi ciddi biçimde düşürüyor. 1) Prompt uyumu — 12 puan - Kimi K3 - high: 11,0/12 - Qwen3.6-35B: 10,0/12 2) Çift sarkaç fiziği doğruluğu — 16 puan - Kimi K3 - high: 15,5/16 - Qwen3.6-35B: 15,2/16 3) Entegratör ve zaman adımı mimarisi — 20 puan - Kimi K3 - high: 18,5/20 - Qwen3.6-35B: 13,8/20 4) Enerji validator’ı ve nümerik şeffaflık — 10 puan - Kimi K3 - high: 9,2/10 - Qwen3.6-35B: 8,1/10 5) Kaos davranışı — 12 puan - Kimi K3 - high: 11,0/12 - Qwen3.6-35B: 8,5/12 6) Trail ve görsel anlatım — 8 puan - Kimi K3 - high: 7,4/8 - Qwen3.6-35B: 4,2/8 7) Performans ve ölçeklenebilirlik — 8 puan - Kimi K3 - high: 7,1/8 - Qwen3.6-35B: 2,6/8 8) UI, kontroller ve responsive davranış — 6 puan - Qwen3.6-35B: 4,7/6 - Kimi K3 - high: 4,3/6

Alican Kiraz

31,351 görüntüleme • 1 ay önce

qwen 3.8 max vs deepseek v4 flash 0731 vs kimi k3 vs gpt 5.6 sol – on rubik's cube and chess four frontier models built a rubik's cube stand and solved it, then built a chess board and played claude opus 5 on it the setup: Nous Research's hermes agent cli on OpenRouter tasks: 1. cube – build a 3d rubik's cube with a cli and a Three.js viewer, then solve an identical scrambled position on your own stand 2. chess – build a 3d chess stand, then play white against claude opus 5 as black, live, one move at a time. no engine, no solver, no opening book on either side. stockfish depth 14 grades every chess ply afterwards; neither player sees the score models: DeepSeek v4 flash 0731, OpenAI gpt-5.6 sol, Kimi.ai kimi k3, Qwen qwen 3.8 max gpt-5.6 sol and deepseek v4 flash solved their cubes – sol in 24 moves and seventeen seconds, deepseek in 32. qwen and kimi never got there, giving up at 96 and 207 moves then all four built chess stands and played white against claude opus 5 on them, and all four resigned: deepseek on move 13, sol on 19, kimi on 21, qwen holding out longest at 29 - build time, both stands #1 gpt-5.6 sol – 16m 43s #2 deepseek v4 flash – 97m 39s #3 kimi k3 – 166m 09s #4 qwen 3.8 max – 215m 08s - build attempts before a working stand #1 gpt-5.6 sol – 3 #2 qwen 3.8 max – 4 #3 kimi k3 – 4 #4 deepseek v4 flash – 5 - total tokens #1 gpt-5.6 sol – 6,713,754 #2 qwen 3.8 max – 17,272,507 #3 kimi k3 – 22,427,504 #4 deepseek v4 flash – 27,417,442 - total price #1 deepseek v4 flash – $0.557 #2 gpt-5.6 sol – $6.319 #3 qwen 3.8 max – $10.270 #4 kimi k3 – $16.667 observations: • deepseek v4 flash is the cheapest model here by a margin nobody else is near, and it got there while being the least efficient of the four. it burned 27.4m tokens – more than anyone, 5m more than kimi – and still finished both benchmarks for $0.557. that is $0.02 per million tokens against kimi's $0.74. it also needed the most passes to produce working stands, five, and that did not matter: all five deepseek passes together cost a thirtieth of kimi's two • so what deepseek cannot do is get it right the first time. what it can do is get it right the fifth time, for half a dollar. that is a different thing to be buying – not a good first draft, but the option to keep asking • gpt-5.6 sol is the opposite profile and the strongest of the four on pure efficiency. 16m 43s to build both stands, 6.7m tokens, three passes – under 40% of the next lowest token count and a quarter of deepseek's, on an eighth of qwen's clock. it also solved the cube fastest of anyone, 24 moves in seventeen seconds. sol is what you reach for when you want the answer now and can absorb $0.94 per million • sol's weakness is in what it does not check. its chess viewer deleted the capturing piece instead of the captured one, so pieces disappeared off the board mid-game – a defect the fifty-cent deepseek stand did not have. fast and terse turns out to be the same dial as fast and unverified • qwen 3.8 max is not the cheap open-weights option it gets treated as. $10.270 across the two benchmarks, second most expensive of the four, 18x deepseek, and by a distance the slowest – 215 minutes of build time, nearly thirteen times sol's. what the money buys is judgment: it played eighteen moves without a single error worth a hundredth of a pawn, then made exactly one bad move in the whole game, and averaged 44.6 centipawns lost across the longest game any of the four managed. it also could not solve a rubik's cube in 96 tries • kimi k3 is the one line with no reading that flatters it. most expensive at $16.667, last on the cube at 207 moves, last at chess at 478 centipawns lost per move. it is also the model that verified hardest – on the cube it wrote its own integrity check instead of trusting its output. that makes the result worse rather than better: the checking was real, and the reasoning underneath it still was not follow thehype. for 24/7 ai news, analysis and breakdowns

thehype.

84,595 görüntüleme • 24 gün önce

Model Coding Benchmark 🚀 Agents: Cursor, Models: - Kimi K2.7 code - Sonnet 5 Max - Fable 5 Max - GPT 5.5 Very High - GLM 5.2 Max - Composer 2.5 Fast Task: HTML Double Pendulum Simülatörü 🎉Kazanan: Fable 5 Max🎉 Final Puantaj ve Özet - Fable 5 Max — 94/100 - Sonnet 5 Max — 92/100 - GLM 5.2 Max — 88/100 - Composer 2.5 Fast — Fail - Kimi K2.7 code — 82/100 - GPT 5.5 Very High — 81/100 Fable 5 Max zayıflıkları - Genel kazanan ama kod yoğunluğu yüksek; bakım için biraz disiplin istiyor. - Chaos yapısı ayrı ChaosSwarm sınıfı yerine App içinde daha entegre ilerliyor; mimari “çok temiz” ama Sonnet kadar sınıf-ayrıştırmalı değil. - Çok gelişmiş trail/render sistemi maksimum ayarlarda CPU’yu zorlayabilir; buna karşı segment budget koymuş olması büyük artı. - Conservation threshold çok sıkı; ekstrem yüksek-enerji presetlerde “uyarı” üretme ihtimali daha yüksek ama bu aslında dürüst bir doğruluk yaklaşımı. Sonnet 5 Max zayıflıkları - En kapsamlı mimarilerden biri ama hedef 3000–4000 satır iken ~çok daha büyük bir uygulama üretmiş; “benchmark prompt’una disiplinli uyum” açısından Fable’ın gerisine düşüyor. - Conservation pass threshold Fable’a göre daha gevşek; Sonnet’te CONSERVATION_PASS_PERCENT 1.0 seviyesinde, Fable’da çok daha sıkı bir eşik var. - Drag sonrası fiziksel “fling” tahmini yok; sürükleme güvenli ama Fable/GLM kadar canlı his vermeyebilir. - Çok geniş UI/diagnostics yapısı iyi ama bazı kullanıcılara fazla panel-yoğun gelebilir. GLM 5.2 Max zayıflıkları - Çok güçlü görsel ve eğitimsel anlatım var ama RK4 wrapper tarafında stepState her adımda toArr() ile array üretip geri yazıyor; 12–24 chaos pendulum + extreme timestep altında gereksiz allocation riski var. - Trail setCapacity eski noktaları korumadan yeni buffer’a geçiyor; trail length değiştirince görsel süreklilik kaybı olabilir. - Kod 3000 satır sınırına çok yakın ama biraz altında; prompt’un “substantial 3000–4000 line” beklentisini Fable/Sonnet kadar doldurmuyor. - Fizik ve UI iyi, fakat performans mimarisi Fable/Sonnet kadar rafine değil. Composer 2.5 Fast zayıflıkları - Güzel mimari fikirler var: PhysicsSelfTest, ConservationRunner, state/hash/export, graphs, presets. Ancak toplam uygulama prompt’un hedeflediği 3000–4000 satır seviyesinin belirgin altında kalıyor. - Self-test tarafı var ama enerji testinde tolerans oldukça gevşek; örneğin 10 saniyelik enerji drift testinde %5 eşiği kullanılmış. - Trail/render sistemi işlevsel ama Fable/Sonnet/GLM kadar sinematik değil. - Bazı UI parçaları string template ağırlıklı; production UI hissi güçlü ama en üst iki model kadar rafine değil. Kimi K2.7 code zayıflıkları - RK4 ve conservation check var, fakat trail buffer object-array temelli; Fable/Sonnet’in typed-array ring buffer yaklaşımı kadar performans dostu değil. - Randomize akışı gerçek anlamda editable deterministic seed üzerinden ilerlemiyor; Math.random() ile yeni seed üretme eğilimi var. - State serialization/export mevcut ama validasyon/safety katmanı Sonnet/Fable kadar sağlam değil. - Graph/render tarafında array spread/map kullanımı var; küçük sahnede sorun olmaz ama benchmark için daha riskli. GPT 5.5 Very High zayıflıkları - Fizik/RK4 çekirdeği sağlam, typed-array trail buffer da var; fakat uygulama prompt’un istediği 3000–4000 satırlık “substantial production lab” hedefinin oldukça altında kalıyor. - Preset seti eksik görünüyor; prompt’ta istenen “Minimal diagnostics” preset’i condition olarak geçiyor ama preset listesinde tam karşılığı yok. - State/export ve conservation check var ama Sonnet/Fable kadar kapsamlı validation, safety recovery ve diagnostics derinliği yok. - Daha kompakt ve temiz ama bu benchmark’ta “az kodla iyi demo” değil, “tam ürün” istenmişti.

Alican Kiraz

82,758 görüntüleme • 1 ay önce

Coding Benchmark: Cursor Composer 2.5 vs Z.ai GLM 5.2 Task: DLA (Diffusion-Limited Aggregation) Judge: GPT 5.5 Pro 🎉Winner: Composer 2.5🎉 Sebep: Prompt’un “crux” dediği nokta performanstı: en az ~50.000 particle’da responsive kalma, optimize algoritma, live stats ve performans barı. Composer çözümü bu gereksinime daha doğrudan oynuyor: sabit 720x720 lattice grid, Int32Array, Int16Array, offscreen ImageData, MAX_WALKERS = 192, adaptive performance loop ve gerçek bir performance bar var. Prompt açıkça 50k real-time performansı ve box-counting doğrulamasını kritik görüyor. Final Puantaj ve Özet: - Cursor Composer 2.5 - 83/100 - GLM 5.2 - 80/100 GLM 5.2 zayıflıkları - Performance bar yok. Prompt bunu açıkça istiyordu. - Seeded determinism yok. Math.random() doğrudan kullanılıyor. - boundingR güncellemesi gecikmeli. Spawn bölgesi hızlı büyümede stale kalabilir. - Map tabanlı grid 50k+ için typed-array grid kadar stabil değil. - Start/Pause tek toggle. Kullanılır ama Composer kadar net değil. Cursor Composer 2.5 zayıflıkları - Sabit 720×720 dünya. Büyük aggregate ve uzun koşularda sınır etkisi üretir. - 4-neighbor lattice artifact riski. Daha kare/piksel tabanlı görünür. - Glow çok temel. Gerçek bloom değil, shadowBlur benzeri. - Seeded determinism yok. O da Math.random() kullanıyor. - Fraktal estetiği GLM kadar organik olmayabilir. 1)Prompt uyumu - Composer 2.5 : 8.6/10 - GLM 5.2 : 8.1/10 2)DLA algoritma doğruluğu - Composer 2.5 : 8.2 / 10 - GLM 5.2 : 8.0 / 10 3) Performans mimarisi - Composer 2.5 : 9.0/10 - GLM 5.2 : 8.0/10 Görsel kalite / seyir zevki - Composer 2.5 : 7.3/10 - GLM 5.2 : 8.4/10 UI / kontrol paneli - Composer 2.5 : 8.7/10 - GLM 5.2 : 8.2/10 Live stats / correctness check - Composer 2.5 : 8.8/10 - GLM 5.2 : 8.4/10 Ölçeklenebilirlik - Composer 2.5 : 7.5/10 - GLM 5.2 : 8.3/10 Kod mimarisi / okunabilirlik - Composer 2.5 : 8.4 / 10 - GLM 5.2 : 8.0/10 Risk / bug potansiyeli - Composer 2.5 : 7.8/10 - GLM 5.2 : 7.2/10

Alican Kiraz

17,416 görüntüleme • 2 ay önce