Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

10,403,453 Aufrufe • vor 1 Monat •via X (Twitter)

0 Kommentare

Keine Kommentare verfügbar

Kommentare vom Original-Post werden hier angezeigt

Ähnliche Videos

Dostlar sizleri çok şaşırtacak bir benchmark hazırladım. Bu benchmark'da Qwen3.6-35B ile Kimi-K3 2.8T modelini kıyasladım. Biliyorum çok ütopik bir karşılaşma olarak gelebilir size. Ama inanın doğru loop döngüleri ve iterasyonlarla bu iki modelin birbirine nasıl yaklaştığını görünce çok şaşıracaksınız. Bu test sonuçları aslında bize şunu da gösteriyor; alan spesifik doğru model finetuning'leri ve agent yapıları ile bir oyuncu GPU'sunda çalıştırdığınız bir LLM modelinin, Datacenter seviyesindeki bir altyapıda inference edilen bir model ile nasıl yarışabileceğini bize anlatıyor. Kısaca teki bir RTX 5090 32GB'de çalışırken diğeri 3x (8x Nvidia B200 192GB)'de inference edilebiliyor. Bu nedenle Ilya Sutskever'ın da podcast'lerinde bahsettiği gibi artık zaman Araştırma ve Keşif Çağı, Scaling değil... Coding Benchmark: Qwen3.6-35B vs Kimi-K3 High - Judge: ChatGPT 5.6 Pro - Agent: Opencode - Task: Çift sarkaç + iz (trail), Euler vs RK4 entegrasyon farkı burada görünür — kötü modelde sarkaç enerji kazanıp savrulur. Kaos davranışı görsel olarak tatmin edici. Modellerde İterasyon Sayısı ve Cost Miktarı: - Kimi-K3: 3 adet iterasyon - $0.59 cost - Qwen3.6-35B: 8 adet iterasyon - $0.09 cost Final Puantaj ve Özet - Kimi K3 - high — 90,6/100 - Qwen3.6-35B — 71,6/100 Kimi; fizik mimarisi, chaos görselliği, trail doğruluğu, uzun süreli performans ve düşük risk açısından açık biçimde önde. Qwen; daha geniş bir kontrol paneli, fullscreen, screenshot, preset ve ayarlanabilir chaos sayısı sunuyor. Ancak bunların önemli bölümü task’ın core kalitesini yükseltmiyor; hidden ×10 single-mode maliyeti, frame-dependent timestep, ters trail fade’i ve ölü Fade kontrolü toplam kaliteyi ciddi biçimde düşürüyor. 1) Prompt uyumu — 12 puan - Kimi K3 - high: 11,0/12 - Qwen3.6-35B: 10,0/12 2) Çift sarkaç fiziği doğruluğu — 16 puan - Kimi K3 - high: 15,5/16 - Qwen3.6-35B: 15,2/16 3) Entegratör ve zaman adımı mimarisi — 20 puan - Kimi K3 - high: 18,5/20 - Qwen3.6-35B: 13,8/20 4) Enerji validator’ı ve nümerik şeffaflık — 10 puan - Kimi K3 - high: 9,2/10 - Qwen3.6-35B: 8,1/10 5) Kaos davranışı — 12 puan - Kimi K3 - high: 11,0/12 - Qwen3.6-35B: 8,5/12 6) Trail ve görsel anlatım — 8 puan - Kimi K3 - high: 7,4/8 - Qwen3.6-35B: 4,2/8 7) Performans ve ölçeklenebilirlik — 8 puan - Kimi K3 - high: 7,1/8 - Qwen3.6-35B: 2,6/8 8) UI, kontroller ve responsive davranış — 6 puan - Qwen3.6-35B: 4,7/6 - Kimi K3 - high: 4,3/6

Alican Kiraz

31,351 Aufrufe • vor 1 Monat