正在加载视频...

视频加载失败

Cursor Fable 5 Max vs Codex GPT 5.5 Very High 🔥Senaryo: Physarum simülasyonu: Ajan + feromon trail map. Zamanlama: - GPT 5.5 Very High - 17 Dakika - Fable 5 - +40 Dakika Cost: - GPT 5.5 Very High: Yaklaşık 6 Dolar (Codex) - Fable 5 Max: 360,55 Dolar...

95,652 次观看 • 3 个月前 •via X (Twitter)

20 条评论

Alican Kiraz 的头像
Alican Kiraz3 个月前

nasjdnajskndkjasndkasdn

Ferdi ÜNAL 的头像
Ferdi ÜNAL3 个月前

Bu modelin çıkışıyla beraber, 20$'lık aboneliğin bir anlamı kalmamış oldu, 100$ temel giriş, 200$ ve 400$ 'a yakın bir plan seçeneği koyarlar diye düşünüyorum. Haiku = Sonnet, Sonnet = Opus, Opus = Fable gibi düşünmek lazım artık.

RuslanStark 的头像
RuslanStark3 个月前

Ali abi, bu firmaların sürekli olarak yüksek maliyetli modeller sunması ve bu stratejiyi tereddütsüz bir şekilde uygulamaları, halka arz sürecinde maksimum finansal kazanç elde etme amacı taşıdığı yönündeki düşünceme katılır mısın?

Alican Kiraz 的头像
Alican Kiraz3 个月前

Aynen, en iyi modele sahip olmak için maliyeti unuttular

Batuhan 的头像
Batuhan3 个月前

Bu nasıl opusun 2 katı fiyat 😂 Maşallah 2000 dolarlık paketler geliyor gibi

Gürol Çaydaş 的头像
Gürol Çaydaş3 个月前

bana biyoloji konularında engel oldu.

cemkaya 的头像
cemkaya3 个月前

Acaba gemini 3.5 pro nasil bir performans gösterecek

bardakçı samo 的头像
bardakçı samo3 个月前

eline sağlık abi

Alican Kiraz 的头像
Alican Kiraz3 个月前

Teşekkür ederim

Burak Kaan Köse 的头像
Burak Kaan Köse3 个月前

Tam görmek istediğim senaryo. Elinize sağlık. Fable kesinlikle SWE benchindeki farkın hakkını veriyor.

canberk 的头像
canberk3 个月前

opus 4.8'in çıktısı ne olurdu acaba

Ahmet Doğan 的头像
Ahmet Doğan3 个月前

çok değerli çalışma eline sağlık 🙌🏻

Alican Kiraz 的头像
Alican Kiraz3 个月前

Teşekkür ederim

Nidanur Cabbar🕊 ⟭⟬⁷⟬⟭ 的头像
Nidanur Cabbar🕊 ⟭⟬⁷⟬⟭3 个月前

Yutkunamadım

Kutay Cumhur Barut 的头像
Kutay Cumhur Barut3 个月前

Neden Physarum simülasyonu diye sormaktan model performanslarına odaklanamadım. Neden herkesin anlayacağı Çift Yarık Simülasyonu değilde Physarum? AI modeline bir şey diyemem fakat hava atmak için çok pahalı bi model olmuş :)

林悦己Cheer 的头像
林悦己Cheer3 个月前

Another valuable post from you on Fable 5 vs GPT-5.5 Cost and Quality Comparison. We documented this separate case in our Fable 5 repo: This helps the community compare results.

markoloko 的头像
markoloko3 个月前

Performatif erkeğin llmcisi de böyle mi oluyor :). Şaka bi yana eline sağlık çok güzel olmuş karşılaştırma

安叫兽|Bird🕊️ 🔶 BNB 的头像
安叫兽|Bird🕊️ 🔶 BNB3 个月前

360刀这下黏菌也肉疼了

The AI Therapist 的头像
The AI Therapist3 个月前

3x slower on reasoning-heavy tasks probably means Fable's spending more tokens on planning (good sign). The real comparison: cost per correct solution, not wall time.

Emre Tarhan 的头像
Emre Tarhan3 个月前

anthropic hq bombalanması lazım abi 360 dolar ne

相关视频

Model Coding Benchmark 🚀 Agents: Cursor, Models: - Kimi K2.7 code - Sonnet 5 Max - Fable 5 Max - GPT 5.5 Very High - GLM 5.2 Max - Composer 2.5 Fast Task: HTML Double Pendulum Simülatörü 🎉Kazanan: Fable 5 Max🎉 Final Puantaj ve Özet - Fable 5 Max — 94/100 - Sonnet 5 Max — 92/100 - GLM 5.2 Max — 88/100 - Composer 2.5 Fast — Fail - Kimi K2.7 code — 82/100 - GPT 5.5 Very High — 81/100 Fable 5 Max zayıflıkları - Genel kazanan ama kod yoğunluğu yüksek; bakım için biraz disiplin istiyor. - Chaos yapısı ayrı ChaosSwarm sınıfı yerine App içinde daha entegre ilerliyor; mimari “çok temiz” ama Sonnet kadar sınıf-ayrıştırmalı değil. - Çok gelişmiş trail/render sistemi maksimum ayarlarda CPU’yu zorlayabilir; buna karşı segment budget koymuş olması büyük artı. - Conservation threshold çok sıkı; ekstrem yüksek-enerji presetlerde “uyarı” üretme ihtimali daha yüksek ama bu aslında dürüst bir doğruluk yaklaşımı. Sonnet 5 Max zayıflıkları - En kapsamlı mimarilerden biri ama hedef 3000–4000 satır iken ~çok daha büyük bir uygulama üretmiş; “benchmark prompt’una disiplinli uyum” açısından Fable’ın gerisine düşüyor. - Conservation pass threshold Fable’a göre daha gevşek; Sonnet’te CONSERVATION_PASS_PERCENT 1.0 seviyesinde, Fable’da çok daha sıkı bir eşik var. - Drag sonrası fiziksel “fling” tahmini yok; sürükleme güvenli ama Fable/GLM kadar canlı his vermeyebilir. - Çok geniş UI/diagnostics yapısı iyi ama bazı kullanıcılara fazla panel-yoğun gelebilir. GLM 5.2 Max zayıflıkları - Çok güçlü görsel ve eğitimsel anlatım var ama RK4 wrapper tarafında stepState her adımda toArr() ile array üretip geri yazıyor; 12–24 chaos pendulum + extreme timestep altında gereksiz allocation riski var. - Trail setCapacity eski noktaları korumadan yeni buffer’a geçiyor; trail length değiştirince görsel süreklilik kaybı olabilir. - Kod 3000 satır sınırına çok yakın ama biraz altında; prompt’un “substantial 3000–4000 line” beklentisini Fable/Sonnet kadar doldurmuyor. - Fizik ve UI iyi, fakat performans mimarisi Fable/Sonnet kadar rafine değil. Composer 2.5 Fast zayıflıkları - Güzel mimari fikirler var: PhysicsSelfTest, ConservationRunner, state/hash/export, graphs, presets. Ancak toplam uygulama prompt’un hedeflediği 3000–4000 satır seviyesinin belirgin altında kalıyor. - Self-test tarafı var ama enerji testinde tolerans oldukça gevşek; örneğin 10 saniyelik enerji drift testinde %5 eşiği kullanılmış. - Trail/render sistemi işlevsel ama Fable/Sonnet/GLM kadar sinematik değil. - Bazı UI parçaları string template ağırlıklı; production UI hissi güçlü ama en üst iki model kadar rafine değil. Kimi K2.7 code zayıflıkları - RK4 ve conservation check var, fakat trail buffer object-array temelli; Fable/Sonnet’in typed-array ring buffer yaklaşımı kadar performans dostu değil. - Randomize akışı gerçek anlamda editable deterministic seed üzerinden ilerlemiyor; Math.random() ile yeni seed üretme eğilimi var. - State serialization/export mevcut ama validasyon/safety katmanı Sonnet/Fable kadar sağlam değil. - Graph/render tarafında array spread/map kullanımı var; küçük sahnede sorun olmaz ama benchmark için daha riskli. GPT 5.5 Very High zayıflıkları - Fizik/RK4 çekirdeği sağlam, typed-array trail buffer da var; fakat uygulama prompt’un istediği 3000–4000 satırlık “substantial production lab” hedefinin oldukça altında kalıyor. - Preset seti eksik görünüyor; prompt’ta istenen “Minimal diagnostics” preset’i condition olarak geçiyor ama preset listesinde tam karşılığı yok. - State/export ve conservation check var ama Sonnet/Fable kadar kapsamlı validation, safety recovery ve diagnostics derinliği yok. - Daha kompakt ve temiz ama bu benchmark’ta “az kodla iyi demo” değil, “tam ürün” istenmişti.

Alican Kiraz

82,843 次观看 • 2 个月前

GPT-5.6 vs GPT-5.5 on my custom spaceship prompt. I gave both models the exact same custom prompt. This is also the same prompt I previously gave to Fable 5. For context, GPT-5.6 Pro worked for 87 minutes, while GPT-5.5 Extra High worked for 34 minutes and 42 seconds. As I’ve said before, based on great authority GPT-5.6 will be an incremental/soldi improvement over GPT-5.5, not a “Fable killer.” My rough expectation has been that it would trade blows with Fable 5 on some benchmarks, maybe win around half depending on the category, but not clearly surpass it overall. And again fable five will have bigger model smell, but this was expected. After testing this coding output, that view feels pretty accurate. GPT-5.6 is clearly better than GPT-5.5 in several visual areas. The lighting, shading, chairs, object details, and exterior of the spaceship looked noticeably stronger. The scene was also easier to test. I do want to give GPT-5.5 credit though. It built out the rooms much much better and the planets looked better than GPT-5.6’s. It was also interesting that both GPT-5.5 and GPT-5.6 produced better-looking planets than Fable 5 in this specific test. The downside with GPT-5.5 was stability. The game was much glitchier and harder to test compared to GPT-5.6. But when it comes to the core of the demo, which is the spaceship itself, Fable 5 still beat both models pretty comfortably. GPT-5.6 is impressive, but from this test, it looks exactly like what I expected which was a meaningful incremental improvement over GPT-5.5, at least for indie game demos, but not something that replaces Fable 5. In collaboration with Chetaslua

Chris

250,919 次观看 • 3 个月前