
Alican Kiraz
@AlicanKiraz0 • 39,023 subscribers
Chasing AGI & Building the Future of AI @trendyoltech
Shorts
Videos

Dostlar karşınızda Açık Kaynak finetuned Ses modelim Kahya-TTS 🎉 Modelimin adını rahmetli sanatçımız Ayhan Kahya'ya ithafen Kahya olarak koymak istedim. OpenBMB 'in harika modeli openbmb/VoxCPM2 üzerine kapsamlı çeşitli finetuning çalışmaları sonrası oldukça akıcı, vurgulu ve duygu sentezli bir Türkçe çıkarım elde edebildim. Haftaya açık kaynak olarak modelin paylaşımını sağlayacağım. 🎉
Alican Kiraz40,732 Aufrufe • vor 11 Tagen

Dostlar karşınızda Kahya-TTS: State-of-Art Turkish Open Source TTS modelim ❤️ İsmini Rahmetli Ses Sanatçımız Ayhan Kahya'ya ithafen "Kahya" koydum, YouTube videolarımdan ve çeşitli ses kayıtlarımdan +50 Saatlik bir dataset oluşturarak oldukça gelişmiş bir finetune'nin altyapısı ile tasarladım. Ses rengi ve tonunu hizalamak içinde çeşitli teknikler kullandım. openbmb'in VoxCPM2-2B base modelini kullanarak geliştirmelerimi yaptım. Umarım ülkemize ve harika dilimiz Türkçe'mizle nice projelere ve başarılara kapı açar. 🙏🏻 "Başkalarına ışık tutanlar asla karanlıkta kalmazlar..."
Alican Kiraz319,622 Aufrufe • vor 3 Monaten

Bu kez Askeri SIHA için tespit sınıfı bir real-time analiz yaptırdım. Tehdit odaklı; Binek araç (ambulans tipi olduğundan transit’leri hariç tutturdum), aktif akış olan yolları ve çevreyi gözlemleyebilecek yüksek bina’ların aktif nesne takibi yaptırdım.🔥☠️ DGX Spark’ın bu konuda vram’i yetmedi Mac Studio M3 ultra 512 ile yaptım. Analizi SAM3 ile yaptırdım. ⚡️🦾
Alican Kiraz457,271 Aufrufe • vor 9 Monaten

Wow, TeslaBot hala satışa çıkmadı ama Neo sonradan duyrulmasına rağmen satışa çıkmış 😳🔥
Alican Kiraz427,544 Aufrufe • vor 10 Monaten

Dostlar bu arada Kahya-TTS için Mesut Çevik abinin ücretsiz olan Kantan uygulamasının, güncelleme notları haberini hiç harness yapmadan plain-text vererek seslendirdim. Ekten dinleyebilirsiniz. 🎉 İngilizce çoğu kelimeyi akıcı türkçe ile harmanlayarak seslendirme nedeni 4-8-10 saniyelik kesitlerde karma kelime kullanımlı datasetim ile finetune yapmasından dolayı başarılı. 🎉
Alican Kiraz16,484 Aufrufe • vor 10 Tagen

Advanced Frontier LLM Benchmark - Üç Cisim & Gravity Choreography 🚀 - Modeller: Grok 4.6 / AI at Meta Muse Spark 1.3 / Claude Fable 5.1 / Google Gemini Gemini 3.8 Flash - Effort: Max & Very high - Agent: Cursor & Opencode Task: Görev, modele tek bir HTML dosyası içinde, dış kaynak kullanmadan, Canvas 2D ile düzlemsel N-cisim kütleçekimi simülasyonu yazdırmak; bu simülasyon açıldığı anda deterministik bir sinematik gösteriyle başlıyor (Kepler yörüngesi → hiyerarşik yıldız sistemi → figure-8 koreografisi → 12 kopyalı kaotik ayrışma → uzun pozlama), ayrıca ~40 saniyelik video kaydı için ayrı bir demo reel modu, gizli fizik self-check'i, korunum diagnostikleri, sürüklenebilir cisimler ve kompakt bir arayüz içeriyor. 🎉 Fiyat/Performans Kazanan: Grok 4.6🎉 🎉 Core Teknik Kazanan: Fable 5.1 🎉 Sebep: Fable, bu benchmark'ın iki tarafını en iyi birlikte çözüyor: solver ve cinematic renderer. Pairwise Newtonian çekirdek, softened potential, conservation diagnostics, Verlet/Yoshida yolu ve validator mimarisi güçlü; runtime self-check sonuçları da dört model içindeki en iyi seviyede. Daha önemlisi, model yalnızca ekrana “PASS” yazmıyor; hidden systems gerçek integrator yoluyla kademeli çalıştırılıyor ve ölçüm sonucundan verdict üretiliyor. Maliyet: - Grok 4.6: $1.10 - Muse Spark 1.3: $1.12 - Gemini 3.8 Flash: $1.3 - Fable 5.1: $6.2 Teknik skor: - Fable 5.1 - 96.4/100 - Grok 4.6 - 92.1/100 - Muse Spark 1.3 - 89.6/100 - Gemini 3.8 Flash - 81.0/100 Performans / $ - Grok 4.6 - 83.7/100 - Muse Spark 1.3 - 80.0/100 - Gemini 3.8 Flash - 62.3/100 - Fable 5.1 - 15.6/100 Teknik İnceleme Metrikleri: 1) Prompt uyumu: Fable'ın substep genişletmesi ve Muse'un bazı spesifikasyonları sadeleştirmesi nedeniyle kimseye 10 vermiyorum. - Fable 5.1: 9.6/10 - Grok 4.6: 9.3/10 - Gemini 3.8 Flash: 8.8/10 - Muse Spark 1.3: 8.2/10 2) Newtonian physics + conservation: Dört modelin de bu kategori şaşırtıcı derecede güçlü. Muse dahil pairwise equal-and-opposite acceleration ve aynı softened potential kernel'ini kullanıyor. - Fable 5.1: 9.9/10 - Grok 4.6: 9.8/10 - Gemini 3.8 Flash: 9.8/10 - Muse Spark 1.3: 9.6/10 3) Symplectic integrasyon + fixed timestep: Gemini'nin Yoshida formülü yanlış değil; puan kaybı scheduler/backlog yönetiminden geliyor. Numerical method doğru, execution model chaos altında sorunlu. - Fable 5.1: 9.6/10 - Grok 4.6: 9.5/10 - Muse Spark 1.3: 9.4/10 - Gemini 3.8 Flash: 8.0/10 4) Self-check / validator doğruluğu: Burada Fable açık lider. Gemini çok yakın; dtExact metodolojik küçük pürüz. Grok/Muse PASS ama validator resolution daha kaba. - Fable 5.1: 10.0/10 - Gemini 3.8 Flash: 9.4/10 - Grok 4.6: 8.6/10 - Muse Spark 1.3: 8.0/10 5) Görsel kalite: Gemini'nin celestial-body shading'i ve UI'sı çok iyi. Fable ise kompozisyon ve “görsel gürültüyü bastırma” açısından biraz daha dengeli. Muse özellikle büyük title choreography ile etkileyici. Grok en restrained olanı. - Fable 5.1: 9.6/10 - Gemini 3.8 Flash: 9.5/10 - Grok 4.6: 9.2/10 - Muse Spark 1.3: 9.1/10 6) Trail rendering: Gemini'nin single-system trail'i güzel; fakat chaos trail timestamp kaynağındaki hata bu kategori için ciddi. - Fable 5.1: 9.7/10 - Grok 4.6: 9.3/10 - Muse Spark 1.3: 9.0/10 - Gemini 3.8 Flash: 7.0/10 Alternatif winner'lar: - En iyi saf numerical correctness: Fable 5.1 - En iyi self-validator: Fable 5.1 - En iyi görsel kalite: Fable 5.1 ≈ Gemini 3.8 Flash - En iyi chaos throughput: Muse Spark 1.3 - En iyi genel mimari: Fable 5.1 - En iyi fiyat/performans: Grok 4.6 - En düşük maliyet: Grok 4.6 - Sadece physics/integrator kodu puanlansaydı: Fable ≈ Grok > Gemini ≈ Muse - Maliyet de kararın temel kriteri olsaydı: Grok > Muse > Gemini >>> Fable
Alican Kiraz18,781 Aufrufe • vor 13 Tagen

Dostlar Selamlar, Opus 5 ve GLM 5.3'ü Satranç müsabakasında 500 bin Stockfish ve High seviye Thinking ile karşı karşıya getirdim. Sonuçlar: Kazanan Opus 5 oldu. - Maç sırasında GLM 5.3 - 10. hamlede yasadışı hamle yaptı. - Motorun en iyisiyle örtüşmeoranı GLM 5.3'de 2/6 iken Opus 5'de 4/6 oldu. - En büyük sapma GLM 5.3'de 418cp (5.O-O) iken Opus 5'de 20cp - Görünen+muhakeme token miktarları GLM 5.3 16.753 + 16.020 iken Opus 5 5.651 + 5.389 oldu. - Düşünme süreleri GLM 5.3'de 4–62 sn arasındayken Opus 5'de 8–37 sn oldu. - Ve Maliyet GLM 5.3'de $0.075 iken Opus 5'de $0.149 oldu. Oyun hamle detaylarına aşağıdan ulaşabilirsiniz.
Alican Kiraz32,964 Aufrufe • vor 25 Tagen

Model Coding Benchmark 🚀 Agents: Cursor, Models: - Kimi K2.7 code - Sonnet 5 Max - Fable 5 Max - GPT 5.5 Very High - GLM 5.2 Max - Composer 2.5 Fast Task: HTML Double Pendulum Simülatörü 🎉Kazanan: Fable 5 Max🎉 Final Puantaj ve Özet - Fable 5 Max — 94/100 - Sonnet 5 Max — 92/100 - GLM 5.2 Max — 88/100 - Composer 2.5 Fast — Fail - Kimi K2.7 code — 82/100 - GPT 5.5 Very High — 81/100 Fable 5 Max zayıflıkları - Genel kazanan ama kod yoğunluğu yüksek; bakım için biraz disiplin istiyor. - Chaos yapısı ayrı ChaosSwarm sınıfı yerine App içinde daha entegre ilerliyor; mimari “çok temiz” ama Sonnet kadar sınıf-ayrıştırmalı değil. - Çok gelişmiş trail/render sistemi maksimum ayarlarda CPU’yu zorlayabilir; buna karşı segment budget koymuş olması büyük artı. - Conservation threshold çok sıkı; ekstrem yüksek-enerji presetlerde “uyarı” üretme ihtimali daha yüksek ama bu aslında dürüst bir doğruluk yaklaşımı. Sonnet 5 Max zayıflıkları - En kapsamlı mimarilerden biri ama hedef 3000–4000 satır iken ~çok daha büyük bir uygulama üretmiş; “benchmark prompt’una disiplinli uyum” açısından Fable’ın gerisine düşüyor. - Conservation pass threshold Fable’a göre daha gevşek; Sonnet’te CONSERVATION_PASS_PERCENT 1.0 seviyesinde, Fable’da çok daha sıkı bir eşik var. - Drag sonrası fiziksel “fling” tahmini yok; sürükleme güvenli ama Fable/GLM kadar canlı his vermeyebilir. - Çok geniş UI/diagnostics yapısı iyi ama bazı kullanıcılara fazla panel-yoğun gelebilir. GLM 5.2 Max zayıflıkları - Çok güçlü görsel ve eğitimsel anlatım var ama RK4 wrapper tarafında stepState her adımda toArr() ile array üretip geri yazıyor; 12–24 chaos pendulum + extreme timestep altında gereksiz allocation riski var. - Trail setCapacity eski noktaları korumadan yeni buffer’a geçiyor; trail length değiştirince görsel süreklilik kaybı olabilir. - Kod 3000 satır sınırına çok yakın ama biraz altında; prompt’un “substantial 3000–4000 line” beklentisini Fable/Sonnet kadar doldurmuyor. - Fizik ve UI iyi, fakat performans mimarisi Fable/Sonnet kadar rafine değil. Composer 2.5 Fast zayıflıkları - Güzel mimari fikirler var: PhysicsSelfTest, ConservationRunner, state/hash/export, graphs, presets. Ancak toplam uygulama prompt’un hedeflediği 3000–4000 satır seviyesinin belirgin altında kalıyor. - Self-test tarafı var ama enerji testinde tolerans oldukça gevşek; örneğin 10 saniyelik enerji drift testinde %5 eşiği kullanılmış. - Trail/render sistemi işlevsel ama Fable/Sonnet/GLM kadar sinematik değil. - Bazı UI parçaları string template ağırlıklı; production UI hissi güçlü ama en üst iki model kadar rafine değil. Kimi K2.7 code zayıflıkları - RK4 ve conservation check var, fakat trail buffer object-array temelli; Fable/Sonnet’in typed-array ring buffer yaklaşımı kadar performans dostu değil. - Randomize akışı gerçek anlamda editable deterministic seed üzerinden ilerlemiyor; Math.random() ile yeni seed üretme eğilimi var. - State serialization/export mevcut ama validasyon/safety katmanı Sonnet/Fable kadar sağlam değil. - Graph/render tarafında array spread/map kullanımı var; küçük sahnede sorun olmaz ama benchmark için daha riskli. GPT 5.5 Very High zayıflıkları - Fizik/RK4 çekirdeği sağlam, typed-array trail buffer da var; fakat uygulama prompt’un istediği 3000–4000 satırlık “substantial production lab” hedefinin oldukça altında kalıyor. - Preset seti eksik görünüyor; prompt’ta istenen “Minimal diagnostics” preset’i condition olarak geçiyor ama preset listesinde tam karşılığı yok. - State/export ve conservation check var ama Sonnet/Fable kadar kapsamlı validation, safety recovery ve diagnostics derinliği yok. - Daha kompakt ve temiz ama bu benchmark’ta “az kodla iyi demo” değil, “tam ürün” istenmişti.
Alican Kiraz82,843 Aufrufe • vor 2 Monaten

Cursor Fable 5 Max vs Codex GPT 5.5 Very High 🔥Senaryo: Physarum simülasyonu: Ajan + feromon trail map. Zamanlama: - GPT 5.5 Very High - 17 Dakika - Fable 5 - +40 Dakika Cost: - GPT 5.5 Very High: Yaklaşık 6 Dolar (Codex) - Fable 5 Max: 360,55 Dolar (Cursor) Evet şaka değil! Algoritma ve Kod Mühendisliği Şampiyonu: Fable 5 🚀 Eğer aradığınız kriter "Bir LLM donanımı son limitine kadar zorlayacak performansı sıfırdan nasıl yazar?" ise F5 kodunu yazan model açık ara kazanmıştır. Açıların hesaplanmasında sin/cos LUT kullanması, render aşamasında Color LUT ile pikselleri paketlemesi ve difüzyon filtresini matematiksel olarak daha efektif olan "Separable Box Blur" haline getirmesi üst düzey bir kıdemli yazılımcı (Senior Engineer) refleksidir. Aestetik, Sunum ve Ürün Vizyonu Şampiyonu: GPT 5.5 Eğer aradığınız kriter "Kodun arkasındaki matematik ne olursa olsun, ekranda ilk saniyede en etkileyici görseli hangisi veriyor ve arayüzü ne kadar kusursuz?" ise G5.5 kodunu yazan model öndedir. Ajanları ekrana rastgele saçmak yerine 8 farklı dairesel küme halinde (cluster)başlatması, simülasyon açılır açılmaz büyüleyici fraktal ağların oluşmasını sağlar (F5'in ağı örmesi 5-10 saniye sürerken G5.5 anında görsel şov sunar). Ayrıca mobil uyumlu arayüzü ve entegre SVG ikonları ürünleştirme başarısını gösterir.
Alican Kiraz95,652 Aufrufe • vor 3 Monaten

AI Homelab’imde son durum; - Mac Studio M3 Ultra 512GB sattım. - Yerine RTX Pro 6000 96GB WS aldım. - Macbook’umu yükletip M5 Max 64GB’e geçtim. - 6x Mac mini M4 + 4x Mac mini M2 ile devam - 2x Nvidia DGX Spark 128GB ile devam bir süpriz gelebilir 🔥 - 2x RTX 5090 32GB ile devam
Alican Kiraz88,334 Aufrufe • vor 4 Monaten

Testleri yaptım; Cursor’da Plan’sız olarak direk Agent modülüyle yaptım. 👑 Gemini 3 Pro Hız, Maliyet ve Kalite’de açık ara en iyi çıktı bence. ☠️ GPT 5.1 Codex High Fast çalışan bir çıktı bile veremedi… 🧠 En iyi Planlamayı Claude Modelleri yaptı. Hız sıralaması; - Gemini 3 Pro > Opus4.1 > Sonnet4.5 > GPT-5.1-Codex High Fast Test Prompt: Write a Python program that shows a ball bouncing inside a spinning hexagon. The ball should be affected by gravity and friction, and it must bounce off the rotating walls realistically.
Alican Kiraz149,106 Aufrufe • vor 10 Monaten

Coding Benchmark 🔥 GPT 5.6 Sol Max vs Fable 5 Max vs GLM 5.2 Max vs Opus 4.8 Max - Part 1 Task: Stable Fluids (Jos Stam) - Modelden tek bir bağımsız HTML dosyasında, Jos Stam'ın Stable Fluids yöntemine dayalı gerçek zamanlı, etkileşimli bir akışkan simülasyonu üretmesi isteniyor — kütüphane yok, zero-shot, tek deneme. Çıktı; semi-Lagrangian advection, iteratif difüzyon ve basınç projeksiyonu adımlarını doğru sırada içermeli, ImageData ile 256×256 gridde akıcı çalışmalı, fareyle boya ve hız enjekte edilebilmeli, ekranda divergence ile kütle korunumunu canlı raporlamalıdır. Final Puantaj ve Özet •GPT 5.6 Sol Max — 91/100 •GLM 5.2 Max — 88/100 •Opus 4.8 Max — 86/100 •Fable 5 Max — 81/100 Maliyetler: - GPT‑5.6 Sol : $54,05–$97,02 - Claude Fable 5 : $78,75 - Claude Opus 4.8 : $15,52 - GLM‑5.2 : $1,17 Neden önemli: Bu benchmark, "çalışıyor gibi görünen ama sessizce yanlış" kodu yakalayan nadir testlerden. Basınç projeksiyonunu atlayan bir model yine hatasız çalışan, boyayı yayan bir animasyon üretir — ama girdap oluşmaz; yani hata derleme değil, fizik seviyesindedir ve ancak çıktıya bakınca anlaşılır. Aynı şekilde, Stam'ın yönteminin tanımlayıcı özelliği koşulsuz kararlılıktır: timestep'i sonuna kadar açtığında doğru implementasyon ayakta kalır, naive ileri fark şeması anında NaN'a düşer. Modelde neyi test eder: Ezberlenmiş kod parçacığı yerine algoritmanın nedenini kavradığını (projeksiyon adımının niye zorunlu olduğunu), sayısal yöntem seçimini (implicit çözücü, geri-izleme, yeterli Poisson iterasyonu), gerçek zamanlı grafik farkındalığını (tek blit vs hücre başına fillRect), ve uzun kodda tutarlılığı — sınır koşulları, alan yönetimi, UI durum yönetimi tek dosyada bozulmadan bir arada duruyor mu. Üstelik değerlendirme sübjektif değil: divergence sıfıra iniyor mu, silindirin arkasında Kármán girdap sokağı beliriyor mu, büyük dt'de hayatta kalıyor mu — üçü de ikili (evet/hayır) sonuç verir, yani "vibecoding" testine nadir bulunan nesnel bir skorlama tabanı sağlar.
Alican Kiraz40,899 Aufrufe • vor 2 Monaten

Dostlar Ai Modellerinin benchmark'ın da daha advance yolları ararken aklıma LLM'lere satranç oynatmak gelmişti. Geliştirdiğim LLM-Chess mimarisi ile seçilen LLM'i belirtilen oyun sayısı ve Thinking eforuna bağlı maça tabi tuttum. İlk olarak Gemini 3.6 Flash vs GPT5.6 Luna'yı müsabakaya tabi tuttum. Kazanan gemini-3.6-flash oldu. 🎉 Gpt-5.6-luna oyunun sonunda 3 hamle hakkında da hamle üretemedi. Metrikler: - gpt-5.6-luna: 258.433 Token ve $0,1555 harcadı. - gemini-3.6-flash: 108.345 Token ve $0,8182 harcadı. - İyi hamle: Luna: 18/22 - Gemini: 22/22 - Yanlışlık/hata: Luna: 3 / 0 / 1 - Gemini: 0 / 0 / 0 - İlk denemede yasal hareket: Luna: 95,65% - Gemini: 100% - En iyi hamle eşleşmesi: Luna: 50,0% -Gemini: 54,55% Analizler: - Gemini 2,4 kat az token kullanıp 5,3 kat fazla ödedi. Efektif birim fiyat 12,5 kat yüksek. - Oyun 48 dakika sürdü. İki LLM'de high effort ile çalıştı. Luna, Gemini'dan 2.7 kat fazla düşündü.
Alican Kiraz23,421 Aufrufe • vor 1 Monat

Dostlar sizleri çok şaşırtacak bir benchmark hazırladım. Bu benchmark'da Qwen3.6-35B ile Kimi-K3 2.8T modelini kıyasladım. Biliyorum çok ütopik bir karşılaşma olarak gelebilir size. Ama inanın doğru loop döngüleri ve iterasyonlarla bu iki modelin birbirine nasıl yaklaştığını görünce çok şaşıracaksınız. Bu test sonuçları aslında bize şunu da gösteriyor; alan spesifik doğru model finetuning'leri ve agent yapıları ile bir oyuncu GPU'sunda çalıştırdığınız bir LLM modelinin, Datacenter seviyesindeki bir altyapıda inference edilen bir model ile nasıl yarışabileceğini bize anlatıyor. Kısaca teki bir RTX 5090 32GB'de çalışırken diğeri 3x (8x Nvidia B200 192GB)'de inference edilebiliyor. Bu nedenle Ilya Sutskever'ın da podcast'lerinde bahsettiği gibi artık zaman Araştırma ve Keşif Çağı, Scaling değil... Coding Benchmark: Qwen3.6-35B vs Kimi-K3 High - Judge: ChatGPT 5.6 Pro - Agent: Opencode - Task: Çift sarkaç + iz (trail), Euler vs RK4 entegrasyon farkı burada görünür — kötü modelde sarkaç enerji kazanıp savrulur. Kaos davranışı görsel olarak tatmin edici. Modellerde İterasyon Sayısı ve Cost Miktarı: - Kimi-K3: 3 adet iterasyon - $0.59 cost - Qwen3.6-35B: 8 adet iterasyon - $0.09 cost Final Puantaj ve Özet - Kimi K3 - high — 90,6/100 - Qwen3.6-35B — 71,6/100 Kimi; fizik mimarisi, chaos görselliği, trail doğruluğu, uzun süreli performans ve düşük risk açısından açık biçimde önde. Qwen; daha geniş bir kontrol paneli, fullscreen, screenshot, preset ve ayarlanabilir chaos sayısı sunuyor. Ancak bunların önemli bölümü task’ın core kalitesini yükseltmiyor; hidden ×10 single-mode maliyeti, frame-dependent timestep, ters trail fade’i ve ölü Fade kontrolü toplam kaliteyi ciddi biçimde düşürüyor. 1) Prompt uyumu — 12 puan - Kimi K3 - high: 11,0/12 - Qwen3.6-35B: 10,0/12 2) Çift sarkaç fiziği doğruluğu — 16 puan - Kimi K3 - high: 15,5/16 - Qwen3.6-35B: 15,2/16 3) Entegratör ve zaman adımı mimarisi — 20 puan - Kimi K3 - high: 18,5/20 - Qwen3.6-35B: 13,8/20 4) Enerji validator’ı ve nümerik şeffaflık — 10 puan - Kimi K3 - high: 9,2/10 - Qwen3.6-35B: 8,1/10 5) Kaos davranışı — 12 puan - Kimi K3 - high: 11,0/12 - Qwen3.6-35B: 8,5/12 6) Trail ve görsel anlatım — 8 puan - Kimi K3 - high: 7,4/8 - Qwen3.6-35B: 4,2/8 7) Performans ve ölçeklenebilirlik — 8 puan - Kimi K3 - high: 7,1/8 - Qwen3.6-35B: 2,6/8 8) UI, kontroller ve responsive davranış — 6 puan - Qwen3.6-35B: 4,7/6 - Kimi K3 - high: 4,3/6
Alican Kiraz31,427 Aufrufe • vor 1 Monat

Şu sahneyi onuncu izleyişim shjdjdjd Uzun zamandır bu kadar gülmemiştim ya 😂😂🧡
Alican Kiraz98,504 Aufrufe • vor 10 Monaten

