değerlendirme
4 özet
- 29 Temmuz 2026 İki ayar puanı üçe katladı: benchmark modeli mi harness'ı mı ölçüyor? OpenAI kendi modelinin bir benchmark'taki düşük puanına şaşırmış. GPT-5.6 Sol matematikte açık problemler çözüyor, Pokémon FireRed'i bitiriyor — ama 2B bulmaca oyunlarından oluşan… OpenAI Research
- 22 Temmuz 2026 13.917 katılımcılı bir çalışma: değerlendirmeyi nasıl kurgularsın Google Research, semptom değerlendirmesi yapan konuşma tabanlı AI prototipleriyle ulusal ölçekte bir karşılaştırmalı çalışma yürütmüş. İlgi çekici kısım tıp değil, deney tasarımı.… Google Research
- 15 Temmuz 2026 Otomatik kırmızı takım: prompt enjeksiyonuna karşı düşmanca eğitim Kırmızı takım (red-teaming) çalışması, modellerdeki açıkları bulmak için şart — ama insan gücüyle ölçeklenmiyor ve bir darboğaz oluşturuyor. Üstelik yaygın kullanılan sağlamlık de… OpenAI Research
- 8 Temmuz 2026 Bozuk benchmark: testin kendisini denetlemek Model yeteneklerini doğru ölçmek, dağıtım ve güvenlik kararları için kritik. Değerlendirmelerin kusurlu olması sadece bir sayıyı bozmaz — yetenekler hakkında yanlış bir anlayış ya… OpenAI Research