Loading video...

Video Failed to Load

Go Home

Nisan 2026 LLM Model Coding Benchmark Task: Çok-şeritli otoyol trafik simülasyonunun sıfırdan, tek dosyada (1000–1500 satır) üretilmesi. Modeller ve IDE'ler: - Deepseek v4-Pro / Kilo-code - GPT 5.5 Very-High / Codex - Opus 4.7 1M Max / Claude Code Task Detay: IDM araç-takip fiziği, MOBIL şerit değiştirme, 3 farklı...

23,087 views • 4 months ago •via X (Twitter)

0 Comments

No comments available

Comments from the original post will appear here

Related Videos

Advanced Frontier LLM Coding Benchmark 13.08.2026 Modeller: - Grok 4.6 Extra High - Cursor - Opus 5 Max - Claude Code (App) - Qwen 3.8 Max - Qwen-Code (CLI) - Kimi K3 Max - Kimi-Code (App) - GLM 5.2 Max - Zcode (App) - GPT 5.6 Sol Very High - Codex (App) - Deepseek-v4-flash-0731 - Qwen-Code (CLI) - Cursor Auto - Cursor (App) - Deepseek-v4-pro-0813 - Opencode (CLI) Görev: Ferrofluid: Metaball yüzeyi + mıknatıs imlecine doğru yükselen Rosensweig dikenleri. Ferrofluid'in zorluğu, "imlece doğru akan sıvı" görünümünün arkasındaki fiziğin bir eşik/bifurkasyon fenomeni olması modellerin %90'ının ıskaladığı nokta. Not: Bu test oldukça zorlu bir yapıda ve frontier benchmark temeldedir. Zorluk katmanları: - Fiziksel modeli doğru anlayıp denklemlere dönüştürme - Kararlı bir SPH/PBF çözücü geliştirme - Manyetik alan, yüzey gerilimi ve histerezis davranışını modelleme - Metaball ve marching-squares ile yüzey çıkarımı - Ölçülebilir ve dürüst bir self-grading sistemi oluşturma - Tarayıcıda yeterli performans sağlama - Görsel olarak anlaşılır bir ürün yüzeyi hazırlama Modellerin Kullanım miktarları ve süreleri: - GPT 5.6 - 57m 6s - $82.1 - Opus 5 - 1s 36m - $106.6 - GLM 5.2 - 1h 2m - $35.7 - Kimi K3 - 1h 23m - $57.3 - Qwen3.8 - 48m 1s - $18 - Deepseek-v4-flash-0731 - 1h 25d - $0.79 - Cursor Auto - 25m 15s - $8-9 - Grok 4.6 - 39m - $5.1 - Deepseek-v4-pro-0813 - 2h 51m - $1.92 Modellerin Performans Tablosu: - Maliyet + Performans Kazanı: Qwen3.8 - Saf teknik ve fiziksel kalite kazananı: Opus 5 - En iyi ultra-düşük maliyetli mühendislik çekirdeği: DeepSeek V4 Pro 0813 - En iyi frontend, ürünleştirme ve gözlemlenebilirlik katmanı: GPT-5.6 Sol - En iyi düşük maliyetli matematiksel eleştirmen: Grok 4.6 - Performans ve sadeleştirme için en uygun yardımcı model: GLM 5.2 Bağımsız saf teknik başarı sıralaması: - Opus 5: 86/100 - Düzenli ve gerçek spike trenine en yakın sonuç. - Qwen3.8: 79/100 - Spike oluşuyor fakat yüksek alanda parçalanma artıyor. - DeepSeek V4 Pro-0813: 64/100 - Gelişmiş çekirdek, fakat ciddi indeksleme riski ve parçalanma - GPT-5.6 Sol: 63/100 - En iyi ürün yüzeyi; fizik çekirdeğinde damlacıklaşma - GLM 5.2: 57/100 - Çok kararlı ve hızlı, fakat tek geniş kubbe üretiyor - Grok 4.6: 53/100 - Matematiksel olarak iyi düşünülmüş, tarayıcı performansı çok düşük - Cursor Auto: 47/100 - Hızlı üretim; garip ince kolonlar, parçalanma ve düşük runtime FPS - Kimi K3: 42/100 - Özellik kapsamı geniş; fiziksel sonuç ve skor güvenilirliği zayıf - DeepSeek V4 Flash-0731: 32/100 - En ucuz; varsayılan görüntü kullanılamaz ve ölçümler yanıltıcı Nasıl kullanmalıyız: - Tek model seçeceksem: Qwen3.8 - Bütçe önemsiz ve en iyi teknik sonucu istiyorsam: Opus 5 - Çok düşük bütçeyle güçlü bir çekirdek istiyorsam: DeepSeek V4 Pro - Sadece frontend ve ürün kalitesi istiyorsam: GPT-5.6 Sol - Formül ve algoritma eleştirmeni istiyorsam: Grok 4.6 - Optimization/refactor istiyorsam: GLM 5.2 - Visual QA istiyorsam: Kimi K3 - Cursor Auto’yu model olarak değil, sabit modelleri yöneten agent harness olarak kullanırım - DeepSeek Flash’ı zorlu caseler dışında, harness yaparak çözeceksem ve disposable boilerplate ile test üretiminde kullanırım.

Alican Kiraz

12,564 views • 15 days ago

Dostlar yeni LLM Coding Benchmark çıktılarımız hazır. 🎉 Bu kez yine zorlu alanları bir araya getiren Trail ile Çift sarkaç: Euler vs RK4 entegrasyonu task'ını test ettim.Bu task ile modellerin hibrit; algoritma, matematik, coding ve Frontend yeteneklerini ölçümledim. Tüm modelleri opencode kullanarak kodlama yaptırdım. Aynı zamanda hepsinde en üst thinking eforu kullandım. Bu kez skorlamada Fiyat/Performans ve Kalite/Performans skalasında yaptım. Değerlendirmeyi modellerin isimlerini görmeden GPT 5.6 Pro yaptı. Testte yer alan Modeller; - DeepSeek V4 Flash 0731 - Gemini 3.6 Flash - Grok 4.5 - Sonnet 5 - GPT5.6-Luna - GPT5.6-Sol - Opus 5 - Kimi K3 - Qwen 3.8 Kalite/Performans - Genel sıralama - Opus 5 — 96.32/100 - $1.4660 - GPT5.6-Sol — 93.85/100 - $0.3627 - GPT5.6-Luna — 92.15/100 - $0.2373 - Kimi K3 — 91.70/100 - $0.3312 - Qwen3.8 — 89.95/100 - $0.2807 - Sonnet 5 — 88.16/100 - $0.4429 - DeepSeek V4 Flash 0731 — 85.12/100 - $0.0994 - Gemini 3.6 Flash — 83.24/100 - $0.0637 - Grok 4.5 — 79.82/100 - $0.4768 Fiyat/performans - Genel sıralama - DeepSeek V4 Flash - 88.00 - GPT5.6-Luna - 87.04 - Qwen 3.8 - 85.75 - Kimi K3 - 84.91 - Gemini 3.6 Flash - 83.57 - GPT5.6-Sol - 82.91 - Grok 4.5 - 81.87 - Sonnet 5 - 80.66 - Opus 5 - 80.22 Genel Değerlendirme: - Prod fiyat/performans kazananı: Qwen3.8. - Maksimum kalite, maliyet önemsiz: Opus 5. - En düşük bütçede yeterli ve tam özellikli çıktı: DeepSeek V4 Flash - En dengeli orta nokta: GPT5.6-Luna ve Kimi K3 Teknik Alan Spesifik Başarı: - En iyi saf numerical integrator: Opus 5 = GPT5.6-Sol - En doğru built-in validator: GPT5.6-Luna - En iyi standart runtime performansı: DeepSeek V4 Flash ve Kimi K3 - En iyi görsel kalite: Opus 5 - En iyi UI/ürün: GPT5.6-Sol - En iyi mimari: Opus 5 - En iyi ekonomik F/P: DeepSeek V4 Flash - En iyi production F/P: GPT5.6-Sol - En pahalı marjinal kalite artışı: Opus 5 - En ciddi validator hatası: Grok 4.5 - En yüksek hot-path/GC riski: Gemini 3.6 Flash

Alican Kiraz

14,814 views • 26 days ago

Model Coding Benchmark 🚀 Agents: Cursor, Models: - Kimi K2.7 code - Sonnet 5 Max - Fable 5 Max - GPT 5.5 Very High - GLM 5.2 Max - Composer 2.5 Fast Task: HTML Double Pendulum Simülatörü 🎉Kazanan: Fable 5 Max🎉 Final Puantaj ve Özet - Fable 5 Max — 94/100 - Sonnet 5 Max — 92/100 - GLM 5.2 Max — 88/100 - Composer 2.5 Fast — Fail - Kimi K2.7 code — 82/100 - GPT 5.5 Very High — 81/100 Fable 5 Max zayıflıkları - Genel kazanan ama kod yoğunluğu yüksek; bakım için biraz disiplin istiyor. - Chaos yapısı ayrı ChaosSwarm sınıfı yerine App içinde daha entegre ilerliyor; mimari “çok temiz” ama Sonnet kadar sınıf-ayrıştırmalı değil. - Çok gelişmiş trail/render sistemi maksimum ayarlarda CPU’yu zorlayabilir; buna karşı segment budget koymuş olması büyük artı. - Conservation threshold çok sıkı; ekstrem yüksek-enerji presetlerde “uyarı” üretme ihtimali daha yüksek ama bu aslında dürüst bir doğruluk yaklaşımı. Sonnet 5 Max zayıflıkları - En kapsamlı mimarilerden biri ama hedef 3000–4000 satır iken ~çok daha büyük bir uygulama üretmiş; “benchmark prompt’una disiplinli uyum” açısından Fable’ın gerisine düşüyor. - Conservation pass threshold Fable’a göre daha gevşek; Sonnet’te CONSERVATION_PASS_PERCENT 1.0 seviyesinde, Fable’da çok daha sıkı bir eşik var. - Drag sonrası fiziksel “fling” tahmini yok; sürükleme güvenli ama Fable/GLM kadar canlı his vermeyebilir. - Çok geniş UI/diagnostics yapısı iyi ama bazı kullanıcılara fazla panel-yoğun gelebilir. GLM 5.2 Max zayıflıkları - Çok güçlü görsel ve eğitimsel anlatım var ama RK4 wrapper tarafında stepState her adımda toArr() ile array üretip geri yazıyor; 12–24 chaos pendulum + extreme timestep altında gereksiz allocation riski var. - Trail setCapacity eski noktaları korumadan yeni buffer’a geçiyor; trail length değiştirince görsel süreklilik kaybı olabilir. - Kod 3000 satır sınırına çok yakın ama biraz altında; prompt’un “substantial 3000–4000 line” beklentisini Fable/Sonnet kadar doldurmuyor. - Fizik ve UI iyi, fakat performans mimarisi Fable/Sonnet kadar rafine değil. Composer 2.5 Fast zayıflıkları - Güzel mimari fikirler var: PhysicsSelfTest, ConservationRunner, state/hash/export, graphs, presets. Ancak toplam uygulama prompt’un hedeflediği 3000–4000 satır seviyesinin belirgin altında kalıyor. - Self-test tarafı var ama enerji testinde tolerans oldukça gevşek; örneğin 10 saniyelik enerji drift testinde %5 eşiği kullanılmış. - Trail/render sistemi işlevsel ama Fable/Sonnet/GLM kadar sinematik değil. - Bazı UI parçaları string template ağırlıklı; production UI hissi güçlü ama en üst iki model kadar rafine değil. Kimi K2.7 code zayıflıkları - RK4 ve conservation check var, fakat trail buffer object-array temelli; Fable/Sonnet’in typed-array ring buffer yaklaşımı kadar performans dostu değil. - Randomize akışı gerçek anlamda editable deterministic seed üzerinden ilerlemiyor; Math.random() ile yeni seed üretme eğilimi var. - State serialization/export mevcut ama validasyon/safety katmanı Sonnet/Fable kadar sağlam değil. - Graph/render tarafında array spread/map kullanımı var; küçük sahnede sorun olmaz ama benchmark için daha riskli. GPT 5.5 Very High zayıflıkları - Fizik/RK4 çekirdeği sağlam, typed-array trail buffer da var; fakat uygulama prompt’un istediği 3000–4000 satırlık “substantial production lab” hedefinin oldukça altında kalıyor. - Preset seti eksik görünüyor; prompt’ta istenen “Minimal diagnostics” preset’i condition olarak geçiyor ama preset listesinde tam karşılığı yok. - State/export ve conservation check var ama Sonnet/Fable kadar kapsamlı validation, safety recovery ve diagnostics derinliği yok. - Daha kompakt ve temiz ama bu benchmark’ta “az kodla iyi demo” değil, “tam ürün” istenmişti.

Alican Kiraz

82,758 views • 1 month ago