Editörden

OpenAI bugün iki şey yayımladı ve ikisi aynı soruya cevap veriyor: agent'ı hem ucuz hem hızlı nasıl çalıştırırsın? Birincisi “daha düşük akıl yürütme çabası”, ikincisi “daha hızlı donanım”. Pazarlama dilini süzünce geriye üç somut API kalıbı kalıyor.

Günün Kapağı
OpenAI Research 13 Ağustos 20265 dk okuma orta

Agent maliyetini düşürmenin üç yolu: çabayı azalt, işi paralelleştir, deterministik işi koda taşı

The builder’s guide to GPT‑5.6

OpenAI'ın startup'lar için yazdığı rehber, GPT-5.6 ailesinin fiyat-performans iddiasını somut kalıplara bağlıyor. Ana gözlem şu: harness sabit tutulduğunda, Agents' Last Exam testinde GPT-5.6 Sol “low” akıl yürütmeyle, GPT-5.5'i “high” akıl yürütmede geride bıraktı. Üretimdeki startup'lar da önceki varsayılanlara göre akıl yürütme çabasını düşürerek ciddi maliyet kazancı bildiriyor. Küçük modeller (Luna, Terra) ise daha fazla test-zamanı hesabıyla çoğu zaman GPT-5.4 ve 5.5'e yakın çalışıyor ve belirgin biçimde daha ucuz. Örnek olarak BrowseComp'ta üç ay önce GPT-5.5 (Extra High) 84,36% puanı 33,27 dolara almıştı.

Rehberin asıl değeri üç Responses API kalıbı: (1) Yapılmış işi yeniden kullan: akıl yürütmeyi turlar arasında kalıcı tut ve uzun konuşmaları yerel sıkıştırmayla (compaction) taşı. (2) Uygun yerde paralel ayrıştır: yerel çoklu-ajan orkestrasyonuyla paralel iş akışlarını koordine et. (3) Deterministik işi koda taşı: programatik araç çağırmayla araç çıktılarını modelin bağlamı dışında süz, topla ve yönet; model token'ını yargı gerektiren işe ayır.

Yani yazı model karşılaştırmasından çok bir tasarım listesi: neyi modele, neyi koda, neyi paralele verdiğine göre maliyet değişiyor.

Öne çıkanlar

  • Yeni model nesli, aynı görevi daha düşük akıl yürütme çabasıyla çözebilir; varsayılan çabayı gözden geçirmek ilk hamle.
  • Akıl yürütmeyi turlar arasında kalıcı tutmak ve bağlamı sıkıştırmak, uzun görevlerde tekrarı azaltır.
  • Filtreleme, toplama gibi deterministik işleri modelin bağlamı dışında kodla yapmak token ve gecikme tasarrufu sağlar.
  • Küçük model + daha fazla test-zamanı hesabı, çoğu iş yükünde pahalı modele yaklaşabilir.

Neden önemli?

Agent maliyetinin büyük kısmı modelin tekrar tekrar aynı şeyi düşünmesinden ve gereksiz verileri bağlamında taşımasından gelir. Bu yazının üç kalıbı da aynı fikre çıkar: modelin dikkatini yalnızca gerçekten yargı gereken yere harca.

Sende karşılığı

Tradebot'taki ve Mobit'teki LLM akışlarına şu soruları sor: (1) Akıl yürütme çabasını kaç yaptın, hiç düşürüp kalitenin değişip değişmediğini ölçtün mü? Kendi küçük değerlendirme setinde low, medium, high çalıştırıp tabloya dök. (2) Modele 500 satırlık bir araç çıktısı veriyorsan, o satırları kodla süzüp yalnızca ilgili 20'sini vermek hem ucuz hem daha isabetli. DBH'daki 10.000 kaydı sınıflandıran pipeline'da da aynısı geçerli: kural tabanlı kısımları koda, belirsiz kısmı modele bırak.

Sözlük

reasoning effort akıl yürütme çabası
Modelin cevap vermeden önce ne kadar düşüneceğini belirleyen ayar; düşük çaba daha hızlı ve ucuz.
test-time compute test-zamanı hesabı
Eğitimden sonra, cevap üretirken modelin harcadığı ek hesaplama.
context compaction bağlam sıkıştırma
Uzun konuşma geçmişini özetleyerek bağlam penceresinde yer açma.
programmatic tool calling programatik araç çağırma
Araç çağrılarını ve çıktılarını modelin bağlamı dışında kodla yönetme; model yalnızca nihai sonucu görür.
Orijinali oku

Kısa Kısa

OpenAI Research 13 Ağustos 20263 dk okuma başlangıç

Ultrafast: saniyede 750 token ile “hız” artık bir ürün özelliği

Previewing Ultrafast mode: GPT-5.6 Sol at up to 14X the speed

OpenAI, GPT-5.6 Sol'u standart işlemeye göre 14 kata kadar hızlı çalıştıran bir hizmet katmanı olan Ultrafast'i önizlemeye açtı; önce API'de. Katman Cerebras donanımıyla çalışıyor ve saniyede 750 çıktı token'ına kadar üretiyor.

Yazının tezi şu: bugüne dek gerçek zamanlı hız istemek, daha küçük ya da özelleşmiş bir modele inmek demekti. Ultrafast bu takası bozuyor: aynı zekâ, çok daha hızlı. Önerilen kullanım alanları gecikmenin değer taşıdığı yerler: olay müdahalesi (log ve kod değişikliklerinden olası sebebi arıza sürerken bulmak), müşteri desteği ve ses, ve gece boyu süren bir deneyi etkileşimli bir çalışma oturumuna çevirmek.

  • Hız, model boyutundan ayrı bir eksen olarak fiyatlanıyor: aynı model, farklı hizmet katmanı.
  • Önizleme aşamasında; sınırlı sayıda müşteriyle öğreniyorlar.

Sende karşılığı

Bu, 31 Temmuz sayısındaki “model seçimi bir maliyet-hız-kalite kararıdır” fikrinin devamı. Pratik çıkarım: bir özellikte yavaşlık sorunu yaşıyorsan önce şuna bak: darboğaz token üretme hızı mı, yoksa senin kodundaki ardışık çağrılar mı? KlioAI'da bir yanıt 6 saniyede geliyorsa bunun kaç saniyesi modelde, kaçı backend'de, ölçmeden hızlı donanıma para vermek yanlış yere yatırım olur.

Sözlük

service tier hizmet katmanı
Aynı modelin hız, fiyat ve öncelik bakımından farklı seviyelerde sunulması.
tokens per second saniyedeki token
Modelin çıktı üretme hızı; kullanıcının beklediği süreyi doğrudan belirler.
Orijinali oku