İki ayar puanı üçe katladı: benchmark modeli mi harness'ı mı ölçüyor?
How enabling two settings tripled our scores on the ARC-AGI-3 benchmark
OpenAI kendi modelinin bir benchmark'taki düşük puanına şaşırmış. GPT-5.6 Sol matematikte açık problemler çözüyor, Pokémon FireRed'i bitiriyor — ama 2B bulmaca oyunlarından oluşan ARC-AGI-3'te sadece %7,8 alıyor. Soru şu: 2B bulmacalar modeller için gerçekten mi bu kadar zor, yoksa başka bir şey mi oluyor?
Cevap ikincisi. Yazının kilit cümlesi şu: benchmark'lar modelleri yalıtılmış hâlde ölçmez. Aynı zamanda daha az görünür tercihleri de ölçerler — API ayarları, harness tasarımı ve prompt'lama. ARC-AGI-3 kasıtlı olarak jenerik bir harness kullanıyor: araç yok, özel özellik yok. Gerekçesi savunulabilir — basit harness modelin eksiklerini daha görünür kılar ve karşılaştırmayı adil tutar. Ama ticari geliştiriciler harness'ı optimize eder, dolayısıyla ölçülen şey iki dünyada aynı değildir.
OpenAI, ChatGPT ve Codex'te zaten kullandıkları iki API ayarını açmış: retained reasoning (akıl yürütmenin turlar arası korunması) ve compaction (bağlam dolduğunda geçmişin özetlenmesi). Sonuç: puan üçe katlanmış ve çıktı token'ları 6 kat azalmış. Yani hem daha iyi hem daha ucuz.
Öne çıkanlar
- Aynı model, aynı görev, farklı harness → 3 kat fark. Puan farkının kaynağı modelde değildi.
- Retained reasoning: modelin bir turdaki akıl yürütmesini sonraki turda kaybetmemesi. Ajanik döngülerde tekrar tekrar aynı şeyi düşünmesini önler.
- Compaction: bağlam sınırına yaklaşırken geçmişi özetleyip yer açma. Uzun süren agent oturumlarında zorunlu hâle geliyor.
- İyileşme token maliyetiyle gelmedi — tersine 6 kat daha az çıktı token'ı kullanıldı.
Neden önemli?
Model karşılaştırma tablolarını okurken bu yazıyı hatırla. Bir puan her zaman "model + harness + prompt + ayarlar" bileşiminin puanıdır. Kendi ürününde bir modeli değerlendirirken de aynısı geçerli: iki modeli farklı harness'larla karşılaştırırsan ölçtüğün şey model değil, senin kurulumundur.
Sende karşılığı
Bu yazı senin en somut faydalanabileceğin şeylerden biri. Bir LLM özelliği yazarken "model kötü" sonucuna varmadan önce şunları kontrol et: bağlam yönetimi doğru mu, önceki turların akıl yürütmesi korunuyor mu, prompt yapısı görevi net anlatıyor mu, araç açıklamaları modele *ne zaman* çağıracağını söylüyor mu? KlioAI'daki değerlendirme özelliğinde beklenenden kötü sonuç alıyorsan, ilk şüphelin model değil harness olsun. Ayrıca kendi değerlendirme setini kur: 20-30 gerçek örnek üzerinde kendi ölçümünü yapmak, dışarıdaki hiçbir benchmark tablosundan alamayacağın bir bilgidir.
Sözlük
- harness koşum takımı
- Modeli çalıştıran çerçeve: prompt yapısı, araçlar, bağlam yönetimi, döngü mantığı. Modelin kendisi kadar sonucu belirler.
- retained reasoning korunan akıl yürütme
- Modelin bir turda ürettiği düşünme adımlarının sonraki turlarda da bağlamda kalması.
- compaction bağlam sıkıştırma
- Konuşma geçmişi bağlam penceresini doldurmaya yaklaşınca eski kısmın özetlenerek yer açılması.
- benchmark karşılaştırma testi
- Modelleri standart bir görev kümesinde ölçen test; sonucu kurulum tercihlerinden bağımsız değildir.