Loading video...

Video Failed to Load

Go Home

Model Coding Benchmark 🚀 Agents: Cursor, Models: - Kimi K2.7 code - Sonnet 5 Max - Fable 5 Max - GPT 5.5 Very High - GLM 5.2 Max - Composer 2.5 Fast Task: HTML Double Pendulum Simülatörü 🎉Kazanan: Fable 5 Max🎉 Final Puantaj ve Özet - Fable 5 Max...

82,843 views • 2 months ago •via X (Twitter)

0 Comments

No comments available

Comments from the original post will appear here

Related Videos

Coding Benchmark: Cursor Composer 2.5 vs Z.ai GLM 5.2 Task: DLA (Diffusion-Limited Aggregation) Judge: GPT 5.5 Pro 🎉Winner: Composer 2.5🎉 Sebep: Prompt’un “crux” dediği nokta performanstı: en az ~50.000 particle’da responsive kalma, optimize algoritma, live stats ve performans barı. Composer çözümü bu gereksinime daha doğrudan oynuyor: sabit 720x720 lattice grid, Int32Array, Int16Array, offscreen ImageData, MAX_WALKERS = 192, adaptive performance loop ve gerçek bir performance bar var. Prompt açıkça 50k real-time performansı ve box-counting doğrulamasını kritik görüyor. Final Puantaj ve Özet: - Cursor Composer 2.5 - 83/100 - GLM 5.2 - 80/100 GLM 5.2 zayıflıkları - Performance bar yok. Prompt bunu açıkça istiyordu. - Seeded determinism yok. Math.random() doğrudan kullanılıyor. - boundingR güncellemesi gecikmeli. Spawn bölgesi hızlı büyümede stale kalabilir. - Map tabanlı grid 50k+ için typed-array grid kadar stabil değil. - Start/Pause tek toggle. Kullanılır ama Composer kadar net değil. Cursor Composer 2.5 zayıflıkları - Sabit 720×720 dünya. Büyük aggregate ve uzun koşularda sınır etkisi üretir. - 4-neighbor lattice artifact riski. Daha kare/piksel tabanlı görünür. - Glow çok temel. Gerçek bloom değil, shadowBlur benzeri. - Seeded determinism yok. O da Math.random() kullanıyor. - Fraktal estetiği GLM kadar organik olmayabilir. 1)Prompt uyumu - Composer 2.5 : 8.6/10 - GLM 5.2 : 8.1/10 2)DLA algoritma doğruluğu - Composer 2.5 : 8.2 / 10 - GLM 5.2 : 8.0 / 10 3) Performans mimarisi - Composer 2.5 : 9.0/10 - GLM 5.2 : 8.0/10 Görsel kalite / seyir zevki - Composer 2.5 : 7.3/10 - GLM 5.2 : 8.4/10 UI / kontrol paneli - Composer 2.5 : 8.7/10 - GLM 5.2 : 8.2/10 Live stats / correctness check - Composer 2.5 : 8.8/10 - GLM 5.2 : 8.4/10 Ölçeklenebilirlik - Composer 2.5 : 7.5/10 - GLM 5.2 : 8.3/10 Kod mimarisi / okunabilirlik - Composer 2.5 : 8.4 / 10 - GLM 5.2 : 8.0/10 Risk / bug potansiyeli - Composer 2.5 : 7.8/10 - GLM 5.2 : 7.2/10

Alican Kiraz

17,416 views • 2 months ago

Coding Benchmark 🔥 GPT 5.6 Sol Max vs Fable 5 Max vs GLM 5.2 Max vs Opus 4.8 Max - Part 1 Task: Stable Fluids (Jos Stam) - Modelden tek bir bağımsız HTML dosyasında, Jos Stam'ın Stable Fluids yöntemine dayalı gerçek zamanlı, etkileşimli bir akışkan simülasyonu üretmesi isteniyor — kütüphane yok, zero-shot, tek deneme. Çıktı; semi-Lagrangian advection, iteratif difüzyon ve basınç projeksiyonu adımlarını doğru sırada içermeli, ImageData ile 256×256 gridde akıcı çalışmalı, fareyle boya ve hız enjekte edilebilmeli, ekranda divergence ile kütle korunumunu canlı raporlamalıdır. Final Puantaj ve Özet •GPT 5.6 Sol Max — 91/100 •GLM 5.2 Max — 88/100 •Opus 4.8 Max — 86/100 •Fable 5 Max — 81/100 Maliyetler: - GPT‑5.6 Sol : $54,05–$97,02 - Claude Fable 5 : $78,75 - Claude Opus 4.8 : $15,52 - GLM‑5.2 : $1,17 Neden önemli: Bu benchmark, "çalışıyor gibi görünen ama sessizce yanlış" kodu yakalayan nadir testlerden. Basınç projeksiyonunu atlayan bir model yine hatasız çalışan, boyayı yayan bir animasyon üretir — ama girdap oluşmaz; yani hata derleme değil, fizik seviyesindedir ve ancak çıktıya bakınca anlaşılır. Aynı şekilde, Stam'ın yönteminin tanımlayıcı özelliği koşulsuz kararlılıktır: timestep'i sonuna kadar açtığında doğru implementasyon ayakta kalır, naive ileri fark şeması anında NaN'a düşer. Modelde neyi test eder: Ezberlenmiş kod parçacığı yerine algoritmanın nedenini kavradığını (projeksiyon adımının niye zorunlu olduğunu), sayısal yöntem seçimini (implicit çözücü, geri-izleme, yeterli Poisson iterasyonu), gerçek zamanlı grafik farkındalığını (tek blit vs hücre başına fillRect), ve uzun kodda tutarlılığı — sınır koşulları, alan yönetimi, UI durum yönetimi tek dosyada bozulmadan bir arada duruyor mu. Üstelik değerlendirme sübjektif değil: divergence sıfıra iniyor mu, silindirin arkasında Kármán girdap sokağı beliriyor mu, büyük dt'de hayatta kalıyor mu — üçü de ikili (evet/hayır) sonuç verir, yani "vibecoding" testine nadir bulunan nesnel bir skorlama tabanı sağlar.

Alican Kiraz

40,899 views • 2 months ago

Advanced Frontier LLM Benchmark - Üç Cisim & Gravity Choreography 🚀 - Modeller: Grok 4.6 / AI at Meta Muse Spark 1.3 / Claude Fable 5.1 / Google Gemini Gemini 3.8 Flash - Effort: Max & Very high - Agent: Cursor & Opencode Task: Görev, modele tek bir HTML dosyası içinde, dış kaynak kullanmadan, Canvas 2D ile düzlemsel N-cisim kütleçekimi simülasyonu yazdırmak; bu simülasyon açıldığı anda deterministik bir sinematik gösteriyle başlıyor (Kepler yörüngesi → hiyerarşik yıldız sistemi → figure-8 koreografisi → 12 kopyalı kaotik ayrışma → uzun pozlama), ayrıca ~40 saniyelik video kaydı için ayrı bir demo reel modu, gizli fizik self-check'i, korunum diagnostikleri, sürüklenebilir cisimler ve kompakt bir arayüz içeriyor. 🎉 Fiyat/Performans Kazanan: Grok 4.6🎉 🎉 Core Teknik Kazanan: Fable 5.1 🎉 Sebep: Fable, bu benchmark'ın iki tarafını en iyi birlikte çözüyor: solver ve cinematic renderer. Pairwise Newtonian çekirdek, softened potential, conservation diagnostics, Verlet/Yoshida yolu ve validator mimarisi güçlü; runtime self-check sonuçları da dört model içindeki en iyi seviyede. Daha önemlisi, model yalnızca ekrana “PASS” yazmıyor; hidden systems gerçek integrator yoluyla kademeli çalıştırılıyor ve ölçüm sonucundan verdict üretiliyor. Maliyet: - Grok 4.6: $1.10 - Muse Spark 1.3: $1.12 - Gemini 3.8 Flash: $1.3 - Fable 5.1: $6.2 Teknik skor: - Fable 5.1 - 96.4/100 - Grok 4.6 - 92.1/100 - Muse Spark 1.3 - 89.6/100 - Gemini 3.8 Flash - 81.0/100 Performans / $ - Grok 4.6 - 83.7/100 - Muse Spark 1.3 - 80.0/100 - Gemini 3.8 Flash - 62.3/100 - Fable 5.1 - 15.6/100 Teknik İnceleme Metrikleri: 1) Prompt uyumu: Fable'ın substep genişletmesi ve Muse'un bazı spesifikasyonları sadeleştirmesi nedeniyle kimseye 10 vermiyorum. - Fable 5.1: 9.6/10 - Grok 4.6: 9.3/10 - Gemini 3.8 Flash: 8.8/10 - Muse Spark 1.3: 8.2/10 2) Newtonian physics + conservation: Dört modelin de bu kategori şaşırtıcı derecede güçlü. Muse dahil pairwise equal-and-opposite acceleration ve aynı softened potential kernel'ini kullanıyor. - Fable 5.1: 9.9/10 - Grok 4.6: 9.8/10 - Gemini 3.8 Flash: 9.8/10 - Muse Spark 1.3: 9.6/10 3) Symplectic integrasyon + fixed timestep: Gemini'nin Yoshida formülü yanlış değil; puan kaybı scheduler/backlog yönetiminden geliyor. Numerical method doğru, execution model chaos altında sorunlu. - Fable 5.1: 9.6/10 - Grok 4.6: 9.5/10 - Muse Spark 1.3: 9.4/10 - Gemini 3.8 Flash: 8.0/10 4) Self-check / validator doğruluğu: Burada Fable açık lider. Gemini çok yakın; dtExact metodolojik küçük pürüz. Grok/Muse PASS ama validator resolution daha kaba. - Fable 5.1: 10.0/10 - Gemini 3.8 Flash: 9.4/10 - Grok 4.6: 8.6/10 - Muse Spark 1.3: 8.0/10 5) Görsel kalite: Gemini'nin celestial-body shading'i ve UI'sı çok iyi. Fable ise kompozisyon ve “görsel gürültüyü bastırma” açısından biraz daha dengeli. Muse özellikle büyük title choreography ile etkileyici. Grok en restrained olanı. - Fable 5.1: 9.6/10 - Gemini 3.8 Flash: 9.5/10 - Grok 4.6: 9.2/10 - Muse Spark 1.3: 9.1/10 6) Trail rendering: Gemini'nin single-system trail'i güzel; fakat chaos trail timestamp kaynağındaki hata bu kategori için ciddi. - Fable 5.1: 9.7/10 - Grok 4.6: 9.3/10 - Muse Spark 1.3: 9.0/10 - Gemini 3.8 Flash: 7.0/10 Alternatif winner'lar: - En iyi saf numerical correctness: Fable 5.1 - En iyi self-validator: Fable 5.1 - En iyi görsel kalite: Fable 5.1 ≈ Gemini 3.8 Flash - En iyi chaos throughput: Muse Spark 1.3 - En iyi genel mimari: Fable 5.1 - En iyi fiyat/performans: Grok 4.6 - En düşük maliyet: Grok 4.6 - Sadece physics/integrator kodu puanlansaydı: Fable ≈ Grok > Gemini ≈ Muse - Maliyet de kararın temel kriteri olsaydı: Grok > Muse > Gemini >>> Fable

Alican Kiraz

18,781 views • 13 days ago