Editörden

Arama ve öneri sistemlerinde yeni bir beklenti var: tek en iyi sonuç değil, birbirini tamamlayan bir sonuç kümesi. Google’ın yazısı bunun maliyet sorununu ele alıyor: her sorguda pahalı akıl yürütme yapmak yerine, öğrenmeyi bir kez ve çevrimdışı yapmak.

Günün Kapağı
Google Research 15 Eylül 20265 dk okuma ileri

Pahalı düşünmeyi sorgu anından eğitime taşımak: Retrieve-for-Train

Bypassing inference bottlenecks: Accelerating complex AI search with Retrieve-for-Train

Modern arama ve öneri uygulamalarından artık tek en iyi eşleşme değil, tutarlı bir sonuç kümesi bekleniyor. ‘Kamp malzemesi’ arayan biri dört kişilik çadırın on küçük varyasyonunu istemez; çadır, uyku tulumu, taşınabilir ocak ve kafa lambası gibi birbirini tamamlayan bir küme ister. Sistemler bunun için sorgu dallandırma (query fan-out) kullanıyor: geniş bir isteği ilişkili alt sorgulara bölüp olası ilgi alanlarını kapsamak. Maliyet sorunu şu: veritabanını bilen bir ayrıştırmayı LLM’e her sorguda çıkarım anında yaptırmak büyük bir ‘düşünme bütçesi’ harcatıyor.

Google’ın ICML 2026 makalesindeki Retrieve-for-Train çerçevesi önce öğretmeni eğitiyor: 4 milyar parametreli açık modeller (Gemma3-4B, Qwen3-4B), her ana istek için tam 10 alt sorgu üretecek şekilde pekiştirmeli öğrenmeyle (GRPO ve soft PPO) ince ayarlanıyor. Ödül, öğeleri tek tek puanlayan klasik alaka değil, küme düzeyinde üç rakip sütunun ağırlıklı toplamı. Bu üçlü birbirini dengeleyen ‘karşı çıpalar’ olarak tasarlanmış: yalnızca veri tabanına oturmayı ödüllendirirsen model anlamsız ama matematiksel olarak doğru noktaya düşen diziler üretip sistemi kandırıyor; hizalama eklersen bu kez isteği tekrar eden eş anlamlılara çöküyor. Vendi Score ile çeşitliliği ödüle katmak bu kestirme yolları kapatıyor.

İkinci adım damıtma: öğretmenin öğrendiği davranış 53,9 milyon parametreli küçük bir difüzyon modeline aktarılıyor. Bu model tüm hedef yönleri sürekli gömme uzayında tek bir, otoregresif olmayan paralel geçişte üretiyor ve otoregresif yaklaşıma göre 12-20 kat hızlanma sağlıyor. Büyük bağlam gruplarında otoregresif dallandırma gecikmesi doğrusal artıp yaklaşık 50 saniyeye çıkarken, difüzyon modeli saniyenin altı ile birkaç saniye arasında kalıyor. Değerlendirme moda (kullanıcı kombinleri, CLIP ile) ve müzik (uzman çalma listeleri, MuLan ile) alanlarında yapılmış; tek sorgu, sıfır atışlı genişletme ve Best-of-N baz çizgilerinin hepsini geçmiş. Sıfır atışlı LLM’ler ‘bohemian festival style’ ve ‘bohemian festival fashion’ gibi neredeyse eş anlamlı alt sorgular üretirken, Retrieve-for-Train ‘bot’ ya da ‘dantel’ gibi gerçekten farklı yönlere dallanıyor.

Öne çıkanlar

  • Kümenin kalitesi (çeşitlilik, kapsama, tamamlayıcılık) tek tek öğelerin alakasından ayrı bir hedeftir.
  • Pahalı akıl yürütmeyi her sorguda yapmak yerine bir kez, çevrimdışı eğitime taşımak gecikme ve maliyeti düşürür.
  • Soyut hedefler (‘çeşitli ve stokta olsun’) ölçülebilir bir ödül fonksiyonuna çevrilebilir.
  • Öğretmen (RL ile eğitilmiş LLM) ve öğrenci (küçük difüzyon modeli) ayrımı: kaliteyi öğretmen, hızı öğrenci sağlıyor.

Neden önemli?

Üretimde LLM’i her istekte ‘düşündürmek’ en pahalı yoldur. Bu yazı, tekrar eden bir görev için akıl yürütmeyi eğitim zamanına kaydırmanın genel bir desen olduğunu gösteriyor: bir kez pahalı öğren, her seferinde ucuz uygula.

Sende karşılığı

RAG’inde tek bir arama yerine alt sorgulara bölme (query decomposition) kullanıyorsan bu doğrudan senin problemin. Mobit’teki doküman aramada ‘şu ihalenin tüm riskleri’ gibi geniş bir soruyu LLM’e her seferinde alt sorulara bölttürüyorsan, bu çağrıyı ölçüp maliyetini gör. Basit bir ilk adım: sık gelen geniş sorular için alt sorgu şablonlarını bir kez çıkarıp önbellekle. Pekiştirmeli öğrenme gerekmeden de ‘çıkarım anındaki işi önceden hesapla’ ilkesinin yarısını elde edersin. Çeşitlilik için de MMR (maximal marginal relevance) gibi basit bir yeniden sıralama, benzer sonuçların sıralamayı doldurmasını engeller.

Sözlük

query fan-out sorgu dallandırma
Geniş bir isteği, olası ilgi alanlarını kapsayacak birkaç ilişkili alt sorguya bölme.
slate sonuç kümesi
Kullanıcıya birlikte sunulan, bir bütün olarak değerlendirilen öğeler listesi.
test-time compute test-zamanı hesabı
Modelin cevap üretirken harcadığı ek hesaplama; arttıkça gecikme ve maliyet de artar.
maximal marginal relevance (MMR) azami marjinal alaka
Sonuçları hem alakalı hem birbirinden farklı olacak şekilde seçen yeniden sıralama tekniği.
Orijinali oku