Netflix öneri sistemini dil modeline devretti: GenRec
GenRec: Towards LLM-Native Recommendation at Netflix · Netflix Technology Blog
Netflix'in üretimdeki öneri modelleri binlerce elle üretilmiş özellik (hand-crafted feature) üzerine kurulu: kullanıcılar, içerikler ve etkileşimler için tasarlanmış özellikler, artı dizi modelleme, özellik etkileşimleri ve çok-görevli hedefler için özelleşmiş mimariler. Yıllar içinde olgunlaşmış bir yığın — ama karmaşıklığı yüzünden yeni bir kullanım senaryosunu eklemek pahalı. Yeni bir içerik türü ya da yeni bir ekran eklemek ciddi özellik mühendisliği, mimari değişiklik, altyapı işi ve deney gerektiriyor.
GenRec bu problemi tersten çözüyor. Netflix kendi temel dil modelini kendi verisiyle post-training'den geçirip bir sıralama (ranking) modeline dönüştürmüş. Yaklaşımın adımları şöyle: kullanıcı geçmişini, içerik metadata'sını ve bağlamı metne çeviriyor (verbalize); Netflix'e uyarlanmış temel modeli sıralama için post-train ediyor; üstüne katalog-farkında bir skorlama başlığı ekliyor; ödül sinyalleriyle uzun vadeli üye değerine hizalıyor.
Sonuç dikkat çekici: geniş ölçekli bir A/B testinde, iyi ayarlanmış üretim modeline karşı hem kısa hem uzun vadeli metriklerde istatistiksel olarak anlamlı iyileşme sağlamış — ve bunu etiketli verinin ve girdi sinyallerinin küçük bir kısmıyla yapmış. Maliyet tarafında ise Netflix'in LLM sunum yığınında prefill-only modda çalışıyor.
Öne çıkanlar
- Ana kazanç doğrulukta değil, karmaşıklıkta: binlerce özellik yerine metne çevrilmiş geçmiş, çok daha az bakım.
- "Verbalization" fikri basit ama güçlü: yapılandırılmış veriyi metne çevirip modelin dünya bilgisinden faydalanmak.
- Prefill-only çalıştırmak maliyeti düşürüyor — model uzun metin üretmiyor, yalnızca skorluyor.
- Az veriyle daha iyi sonuç, olgun bir sistemi değiştirmenin en zor gerekçesini karşılıyor: geçiş maliyetini haklı çıkarıyor.
Neden önemli?
Öneri sistemleri on yıldır özellik mühendisliğiyle ilerliyordu; her iyileşme yeni bir sinyal, yeni bir kolon, yeni bir pipeline demekti. Bu yazı o yaklaşımın sonuna işaret ediyor. Daha genel dersi ise şu: olgun bir sistemin asıl maliyeti çalıştırmak değil, değiştirebilmek. Yeni bir gereksinim geldiğinde ne kadar iş çıkıyorsa, mimarinin gerçek fiyatı odur.
Sende karşılığı
Tradebot'ta özellik mühendisliği yaptıysan bu yazı doğrudan sana. Muhtemelen fiyat, hacim, volatilite üzerinden onlarca gösterge hesapladın; her yeni fikir yeni bir kolon ve yeni bir pipeline demekti. GenRec'in sorduğu soru şu: bu sinyalleri elle üretmek yerine ham geçmişi metne çevirip modele versen ne olurdu? Küçük ölçekte bunu deneyebilirsin — ama asıl alacağın ders "LLM kullan" değil, bakım maliyetini bir metrik olarak ölçmek. "Yeni bir varlık eklemek kaç saatimi alıyor?" sorusunun cevabı, mimarinin sağlık göstergesidir.
Sözlük
- feature engineering özellik mühendisliği
- Ham veriden modelin kullanacağı anlamlı sinyalleri elle tasarlama ve hesaplama işi.
- post-training sonradan eğitim
- Önceden eğitilmiş bir temel modeli, belirli bir görev ve veri kümesi için ek eğitimden geçirme.
- ranker sıralama modeli
- Aday içerikleri kullanıcıya uygunluk sırasına dizen model.
- prefill-only yalnızca ön-doldurma
- Modelin yeni token üretmeden sadece girdiyi işleyip bir skor çıkarması; üretim aşaması olmadığı için çok daha ucuz.