Загрузка видео...

Не удалось загрузить видео

На главную

Model Coding Benchmark 🚀 Agents: Cursor, Models: - Kimi K2.7 code - Sonnet 5 Max - Fable 5 Max - GPT 5.5 Very High - GLM 5.2 Max - Composer 2.5 Fast Task: HTML Double Pendulum Simülatörü 🎉Kazanan: Fable 5 Max🎉 Final Puantaj ve Özet - Fable 5 Max...

82,303 просмотров • 28 дней назад •via X (Twitter)

Комментарии: 0

Нет доступных комментариев

Здесь появятся комментарии из оригинального поста

Похожие видео

Coding Benchmark 🔥 GPT 5.6 Sol Max vs Fable 5 Max vs GLM 5.2 Max vs Opus 4.8 Max - Part 1 Task: Stable Fluids (Jos Stam) - Modelden tek bir bağımsız HTML dosyasında, Jos Stam'ın Stable Fluids yöntemine dayalı gerçek zamanlı, etkileşimli bir akışkan simülasyonu üretmesi isteniyor — kütüphane yok, zero-shot, tek deneme. Çıktı; semi-Lagrangian advection, iteratif difüzyon ve basınç projeksiyonu adımlarını doğru sırada içermeli, ImageData ile 256×256 gridde akıcı çalışmalı, fareyle boya ve hız enjekte edilebilmeli, ekranda divergence ile kütle korunumunu canlı raporlamalıdır. Final Puantaj ve Özet •GPT 5.6 Sol Max — 91/100 •GLM 5.2 Max — 88/100 •Opus 4.8 Max — 86/100 •Fable 5 Max — 81/100 Maliyetler: - GPT‑5.6 Sol : $54,05–$97,02 - Claude Fable 5 : $78,75 - Claude Opus 4.8 : $15,52 - GLM‑5.2 : $1,17 Neden önemli: Bu benchmark, "çalışıyor gibi görünen ama sessizce yanlış" kodu yakalayan nadir testlerden. Basınç projeksiyonunu atlayan bir model yine hatasız çalışan, boyayı yayan bir animasyon üretir — ama girdap oluşmaz; yani hata derleme değil, fizik seviyesindedir ve ancak çıktıya bakınca anlaşılır. Aynı şekilde, Stam'ın yönteminin tanımlayıcı özelliği koşulsuz kararlılıktır: timestep'i sonuna kadar açtığında doğru implementasyon ayakta kalır, naive ileri fark şeması anında NaN'a düşer. Modelde neyi test eder: Ezberlenmiş kod parçacığı yerine algoritmanın nedenini kavradığını (projeksiyon adımının niye zorunlu olduğunu), sayısal yöntem seçimini (implicit çözücü, geri-izleme, yeterli Poisson iterasyonu), gerçek zamanlı grafik farkındalığını (tek blit vs hücre başına fillRect), ve uzun kodda tutarlılığı — sınır koşulları, alan yönetimi, UI durum yönetimi tek dosyada bozulmadan bir arada duruyor mu. Üstelik değerlendirme sübjektif değil: divergence sıfıra iniyor mu, silindirin arkasında Kármán girdap sokağı beliriyor mu, büyük dt'de hayatta kalıyor mu — üçü de ikili (evet/hayır) sonuç verir, yani "vibecoding" testine nadir bulunan nesnel bir skorlama tabanı sağlar.

Alican Kiraz

40,657 просмотров • 21 дней назад