Загрузка видео...

Не удалось загрузить видео

На главную

Coding Benchmark 🔥 GPT 5.6 Sol Max vs Fable 5 Max vs GLM 5.2 Max vs Opus 4.8 Max - Part 1 Task: Stable Fluids (Jos Stam) - Modelden tek bir bağımsız HTML dosyasında, Jos Stam'ın Stable Fluids yöntemine dayalı gerçek zamanlı, etkileşimli bir akışkan simülasyonu üretmesi isteniyor —...

40,899 просмотров • 2 месяцев назад •via X (Twitter)

Комментарии: 0

Нет доступных комментариев

Здесь появятся комментарии из оригинального поста

Похожие видео

Advanced Frontier LLM Coding Benchmark 13.08.2026 Modeller: - Grok 4.6 Extra High - Cursor - Opus 5 Max - Claude Code (App) - Qwen 3.8 Max - Qwen-Code (CLI) - Kimi K3 Max - Kimi-Code (App) - GLM 5.2 Max - Zcode (App) - GPT 5.6 Sol Very High - Codex (App) - Deepseek-v4-flash-0731 - Qwen-Code (CLI) - Cursor Auto - Cursor (App) - Deepseek-v4-pro-0813 - Opencode (CLI) Görev: Ferrofluid: Metaball yüzeyi + mıknatıs imlecine doğru yükselen Rosensweig dikenleri. Ferrofluid'in zorluğu, "imlece doğru akan sıvı" görünümünün arkasındaki fiziğin bir eşik/bifurkasyon fenomeni olması modellerin %90'ının ıskaladığı nokta. Not: Bu test oldukça zorlu bir yapıda ve frontier benchmark temeldedir. Zorluk katmanları: - Fiziksel modeli doğru anlayıp denklemlere dönüştürme - Kararlı bir SPH/PBF çözücü geliştirme - Manyetik alan, yüzey gerilimi ve histerezis davranışını modelleme - Metaball ve marching-squares ile yüzey çıkarımı - Ölçülebilir ve dürüst bir self-grading sistemi oluşturma - Tarayıcıda yeterli performans sağlama - Görsel olarak anlaşılır bir ürün yüzeyi hazırlama Modellerin Kullanım miktarları ve süreleri: - GPT 5.6 - 57m 6s - $82.1 - Opus 5 - 1s 36m - $106.6 - GLM 5.2 - 1h 2m - $35.7 - Kimi K3 - 1h 23m - $57.3 - Qwen3.8 - 48m 1s - $18 - Deepseek-v4-flash-0731 - 1h 25d - $0.79 - Cursor Auto - 25m 15s - $8-9 - Grok 4.6 - 39m - $5.1 - Deepseek-v4-pro-0813 - 2h 51m - $1.92 Modellerin Performans Tablosu: - Maliyet + Performans Kazanı: Qwen3.8 - Saf teknik ve fiziksel kalite kazananı: Opus 5 - En iyi ultra-düşük maliyetli mühendislik çekirdeği: DeepSeek V4 Pro 0813 - En iyi frontend, ürünleştirme ve gözlemlenebilirlik katmanı: GPT-5.6 Sol - En iyi düşük maliyetli matematiksel eleştirmen: Grok 4.6 - Performans ve sadeleştirme için en uygun yardımcı model: GLM 5.2 Bağımsız saf teknik başarı sıralaması: - Opus 5: 86/100 - Düzenli ve gerçek spike trenine en yakın sonuç. - Qwen3.8: 79/100 - Spike oluşuyor fakat yüksek alanda parçalanma artıyor. - DeepSeek V4 Pro-0813: 64/100 - Gelişmiş çekirdek, fakat ciddi indeksleme riski ve parçalanma - GPT-5.6 Sol: 63/100 - En iyi ürün yüzeyi; fizik çekirdeğinde damlacıklaşma - GLM 5.2: 57/100 - Çok kararlı ve hızlı, fakat tek geniş kubbe üretiyor - Grok 4.6: 53/100 - Matematiksel olarak iyi düşünülmüş, tarayıcı performansı çok düşük - Cursor Auto: 47/100 - Hızlı üretim; garip ince kolonlar, parçalanma ve düşük runtime FPS - Kimi K3: 42/100 - Özellik kapsamı geniş; fiziksel sonuç ve skor güvenilirliği zayıf - DeepSeek V4 Flash-0731: 32/100 - En ucuz; varsayılan görüntü kullanılamaz ve ölçümler yanıltıcı Nasıl kullanmalıyız: - Tek model seçeceksem: Qwen3.8 - Bütçe önemsiz ve en iyi teknik sonucu istiyorsam: Opus 5 - Çok düşük bütçeyle güçlü bir çekirdek istiyorsam: DeepSeek V4 Pro - Sadece frontend ve ürün kalitesi istiyorsam: GPT-5.6 Sol - Formül ve algoritma eleştirmeni istiyorsam: Grok 4.6 - Optimization/refactor istiyorsam: GLM 5.2 - Visual QA istiyorsam: Kimi K3 - Cursor Auto’yu model olarak değil, sabit modelleri yöneten agent harness olarak kullanırım - DeepSeek Flash’ı zorlu caseler dışında, harness yaparak çözeceksem ve disposable boilerplate ile test üretiminde kullanırım.

Alican Kiraz

12,765 просмотров • 1 месяц назад

Model Coding Benchmark 🚀 Agents: Cursor, Models: - Kimi K2.7 code - Sonnet 5 Max - Fable 5 Max - GPT 5.5 Very High - GLM 5.2 Max - Composer 2.5 Fast Task: HTML Double Pendulum Simülatörü 🎉Kazanan: Fable 5 Max🎉 Final Puantaj ve Özet - Fable 5 Max — 94/100 - Sonnet 5 Max — 92/100 - GLM 5.2 Max — 88/100 - Composer 2.5 Fast — Fail - Kimi K2.7 code — 82/100 - GPT 5.5 Very High — 81/100 Fable 5 Max zayıflıkları - Genel kazanan ama kod yoğunluğu yüksek; bakım için biraz disiplin istiyor. - Chaos yapısı ayrı ChaosSwarm sınıfı yerine App içinde daha entegre ilerliyor; mimari “çok temiz” ama Sonnet kadar sınıf-ayrıştırmalı değil. - Çok gelişmiş trail/render sistemi maksimum ayarlarda CPU’yu zorlayabilir; buna karşı segment budget koymuş olması büyük artı. - Conservation threshold çok sıkı; ekstrem yüksek-enerji presetlerde “uyarı” üretme ihtimali daha yüksek ama bu aslında dürüst bir doğruluk yaklaşımı. Sonnet 5 Max zayıflıkları - En kapsamlı mimarilerden biri ama hedef 3000–4000 satır iken ~çok daha büyük bir uygulama üretmiş; “benchmark prompt’una disiplinli uyum” açısından Fable’ın gerisine düşüyor. - Conservation pass threshold Fable’a göre daha gevşek; Sonnet’te CONSERVATION_PASS_PERCENT 1.0 seviyesinde, Fable’da çok daha sıkı bir eşik var. - Drag sonrası fiziksel “fling” tahmini yok; sürükleme güvenli ama Fable/GLM kadar canlı his vermeyebilir. - Çok geniş UI/diagnostics yapısı iyi ama bazı kullanıcılara fazla panel-yoğun gelebilir. GLM 5.2 Max zayıflıkları - Çok güçlü görsel ve eğitimsel anlatım var ama RK4 wrapper tarafında stepState her adımda toArr() ile array üretip geri yazıyor; 12–24 chaos pendulum + extreme timestep altında gereksiz allocation riski var. - Trail setCapacity eski noktaları korumadan yeni buffer’a geçiyor; trail length değiştirince görsel süreklilik kaybı olabilir. - Kod 3000 satır sınırına çok yakın ama biraz altında; prompt’un “substantial 3000–4000 line” beklentisini Fable/Sonnet kadar doldurmuyor. - Fizik ve UI iyi, fakat performans mimarisi Fable/Sonnet kadar rafine değil. Composer 2.5 Fast zayıflıkları - Güzel mimari fikirler var: PhysicsSelfTest, ConservationRunner, state/hash/export, graphs, presets. Ancak toplam uygulama prompt’un hedeflediği 3000–4000 satır seviyesinin belirgin altında kalıyor. - Self-test tarafı var ama enerji testinde tolerans oldukça gevşek; örneğin 10 saniyelik enerji drift testinde %5 eşiği kullanılmış. - Trail/render sistemi işlevsel ama Fable/Sonnet/GLM kadar sinematik değil. - Bazı UI parçaları string template ağırlıklı; production UI hissi güçlü ama en üst iki model kadar rafine değil. Kimi K2.7 code zayıflıkları - RK4 ve conservation check var, fakat trail buffer object-array temelli; Fable/Sonnet’in typed-array ring buffer yaklaşımı kadar performans dostu değil. - Randomize akışı gerçek anlamda editable deterministic seed üzerinden ilerlemiyor; Math.random() ile yeni seed üretme eğilimi var. - State serialization/export mevcut ama validasyon/safety katmanı Sonnet/Fable kadar sağlam değil. - Graph/render tarafında array spread/map kullanımı var; küçük sahnede sorun olmaz ama benchmark için daha riskli. GPT 5.5 Very High zayıflıkları - Fizik/RK4 çekirdeği sağlam, typed-array trail buffer da var; fakat uygulama prompt’un istediği 3000–4000 satırlık “substantial production lab” hedefinin oldukça altında kalıyor. - Preset seti eksik görünüyor; prompt’ta istenen “Minimal diagnostics” preset’i condition olarak geçiyor ama preset listesinde tam karşılığı yok. - State/export ve conservation check var ama Sonnet/Fable kadar kapsamlı validation, safety recovery ve diagnostics derinliği yok. - Daha kompakt ve temiz ama bu benchmark’ta “az kodla iyi demo” değil, “tam ürün” istenmişti.

Alican Kiraz

82,843 просмотров • 2 месяцев назад

Coding Benchmark: Cursor Composer 2.5 vs Z.ai GLM 5.2 Task: DLA (Diffusion-Limited Aggregation) Judge: GPT 5.5 Pro 🎉Winner: Composer 2.5🎉 Sebep: Prompt’un “crux” dediği nokta performanstı: en az ~50.000 particle’da responsive kalma, optimize algoritma, live stats ve performans barı. Composer çözümü bu gereksinime daha doğrudan oynuyor: sabit 720x720 lattice grid, Int32Array, Int16Array, offscreen ImageData, MAX_WALKERS = 192, adaptive performance loop ve gerçek bir performance bar var. Prompt açıkça 50k real-time performansı ve box-counting doğrulamasını kritik görüyor. Final Puantaj ve Özet: - Cursor Composer 2.5 - 83/100 - GLM 5.2 - 80/100 GLM 5.2 zayıflıkları - Performance bar yok. Prompt bunu açıkça istiyordu. - Seeded determinism yok. Math.random() doğrudan kullanılıyor. - boundingR güncellemesi gecikmeli. Spawn bölgesi hızlı büyümede stale kalabilir. - Map tabanlı grid 50k+ için typed-array grid kadar stabil değil. - Start/Pause tek toggle. Kullanılır ama Composer kadar net değil. Cursor Composer 2.5 zayıflıkları - Sabit 720×720 dünya. Büyük aggregate ve uzun koşularda sınır etkisi üretir. - 4-neighbor lattice artifact riski. Daha kare/piksel tabanlı görünür. - Glow çok temel. Gerçek bloom değil, shadowBlur benzeri. - Seeded determinism yok. O da Math.random() kullanıyor. - Fraktal estetiği GLM kadar organik olmayabilir. 1)Prompt uyumu - Composer 2.5 : 8.6/10 - GLM 5.2 : 8.1/10 2)DLA algoritma doğruluğu - Composer 2.5 : 8.2 / 10 - GLM 5.2 : 8.0 / 10 3) Performans mimarisi - Composer 2.5 : 9.0/10 - GLM 5.2 : 8.0/10 Görsel kalite / seyir zevki - Composer 2.5 : 7.3/10 - GLM 5.2 : 8.4/10 UI / kontrol paneli - Composer 2.5 : 8.7/10 - GLM 5.2 : 8.2/10 Live stats / correctness check - Composer 2.5 : 8.8/10 - GLM 5.2 : 8.4/10 Ölçeklenebilirlik - Composer 2.5 : 7.5/10 - GLM 5.2 : 8.3/10 Kod mimarisi / okunabilirlik - Composer 2.5 : 8.4 / 10 - GLM 5.2 : 8.0/10 Risk / bug potansiyeli - Composer 2.5 : 7.8/10 - GLM 5.2 : 7.2/10

Alican Kiraz

17,416 просмотров • 2 месяцев назад