Agent maliyetini düşürmenin üç yolu: çabayı azalt, işi paralelleştir, deterministik işi koda taşı
The builder’s guide to GPT‑5.6
OpenAI'ın startup'lar için yazdığı rehber, GPT-5.6 ailesinin fiyat-performans iddiasını somut kalıplara bağlıyor. Ana gözlem şu: harness sabit tutulduğunda, Agents' Last Exam testinde GPT-5.6 Sol “low” akıl yürütmeyle, GPT-5.5'i “high” akıl yürütmede geride bıraktı. Üretimdeki startup'lar da önceki varsayılanlara göre akıl yürütme çabasını düşürerek ciddi maliyet kazancı bildiriyor. Küçük modeller (Luna, Terra) ise daha fazla test-zamanı hesabıyla çoğu zaman GPT-5.4 ve 5.5'e yakın çalışıyor ve belirgin biçimde daha ucuz. Örnek olarak BrowseComp'ta üç ay önce GPT-5.5 (Extra High) 84,36% puanı 33,27 dolara almıştı.
Rehberin asıl değeri üç Responses API kalıbı: (1) Yapılmış işi yeniden kullan: akıl yürütmeyi turlar arasında kalıcı tut ve uzun konuşmaları yerel sıkıştırmayla (compaction) taşı. (2) Uygun yerde paralel ayrıştır: yerel çoklu-ajan orkestrasyonuyla paralel iş akışlarını koordine et. (3) Deterministik işi koda taşı: programatik araç çağırmayla araç çıktılarını modelin bağlamı dışında süz, topla ve yönet; model token'ını yargı gerektiren işe ayır.
Yani yazı model karşılaştırmasından çok bir tasarım listesi: neyi modele, neyi koda, neyi paralele verdiğine göre maliyet değişiyor.
Öne çıkanlar
- Yeni model nesli, aynı görevi daha düşük akıl yürütme çabasıyla çözebilir; varsayılan çabayı gözden geçirmek ilk hamle.
- Akıl yürütmeyi turlar arasında kalıcı tutmak ve bağlamı sıkıştırmak, uzun görevlerde tekrarı azaltır.
- Filtreleme, toplama gibi deterministik işleri modelin bağlamı dışında kodla yapmak token ve gecikme tasarrufu sağlar.
- Küçük model + daha fazla test-zamanı hesabı, çoğu iş yükünde pahalı modele yaklaşabilir.
Neden önemli?
Agent maliyetinin büyük kısmı modelin tekrar tekrar aynı şeyi düşünmesinden ve gereksiz verileri bağlamında taşımasından gelir. Bu yazının üç kalıbı da aynı fikre çıkar: modelin dikkatini yalnızca gerçekten yargı gereken yere harca.
Sende karşılığı
Tradebot'taki ve Mobit'teki LLM akışlarına şu soruları sor: (1) Akıl yürütme çabasını kaç yaptın, hiç düşürüp kalitenin değişip değişmediğini ölçtün mü? Kendi küçük değerlendirme setinde low, medium, high çalıştırıp tabloya dök. (2) Modele 500 satırlık bir araç çıktısı veriyorsan, o satırları kodla süzüp yalnızca ilgili 20'sini vermek hem ucuz hem daha isabetli. DBH'daki 10.000 kaydı sınıflandıran pipeline'da da aynısı geçerli: kural tabanlı kısımları koda, belirsiz kısmı modele bırak.
Sözlük
- reasoning effort akıl yürütme çabası
- Modelin cevap vermeden önce ne kadar düşüneceğini belirleyen ayar; düşük çaba daha hızlı ve ucuz.
- test-time compute test-zamanı hesabı
- Eğitimden sonra, cevap üretirken modelin harcadığı ek hesaplama.
- context compaction bağlam sıkıştırma
- Uzun konuşma geçmişini özetleyerek bağlam penceresinde yer açma.
- programmatic tool calling programatik araç çağırma
- Araç çağrılarını ve çıktılarını modelin bağlamı dışında kodla yönetme; model yalnızca nihai sonucu görür.