LLM
22 özet
- 3 Ağustos 2026 Sesli AI'da altı ayda gerçek zamanlı mimari: sıra beklemeyi bırakmak İnsanlar konuşurken sırayı saniyenin küçük bir kesrinde devralır. Eski sesli asistanlar bunu yakalayamıyordu çünkü mimarileri sıra tabanlıydı (turn-based): önce küçük bir turn det… OpenAI Research
- 13 Nisan 2026 Etkili agent kurmanın sırrı: framework değil, basit desenler Anthropic onlarca ekiple LLM tabanlı agent kuruldu ve şu sonuca varmış: en başarılı uygulamalar karmaşık framework'ler kullanmıyordu, basit ve birleştirilebilir desenler kullanıyo… Anthropic Engineering
- 1 Ağustos 2026 On açık matematik problemi ve 2.000 dolarlık token faturası OpenAI, yayımlanmamış bir modelin uzun süredir açık duran on matematik ve teorik bilgisayar bilimi problemini çözdüğünü ya da ciddi ilerleme kaydettiğini duyuruyor. Problemler yük… OpenAI Research
- 31 Temmuz 2026 Zeka ucuzlayınca ne değişir: model seçimi bir maliyet kararıdır OpenAI'ın altyapı ve fiyatlandırma üzerine yazısı. Ana tez basit: AI altyapısı büyük olduğu için değil, mümkün kıldığı şey yüzünden değerli. Faydalı zekânın maliyeti düştükçe, yap… OpenAI Research
- 30 Temmuz 2026 Netflix öneri sistemini dil modeline devretti: GenRec Netflix'in üretimdeki öneri modelleri binlerce elle üretilmiş özellik (hand-crafted feature) üzerine kurulu: kullanıcılar, içerikler ve etkileşimler için tasarlanmış özellikler, a… Netflix Tech Blog
- 29 Temmuz 2026 İki ayar puanı üçe katladı: benchmark modeli mi harness'ı mı ölçüyor? OpenAI kendi modelinin bir benchmark'taki düşük puanına şaşırmış. GPT-5.6 Sol matematikte açık problemler çözüyor, Pokémon FireRed'i bitiriyor — ama 2B bulmaca oyunlarından oluşan… OpenAI Research
- 29 Temmuz 2026 Modeli hızlandırmak yetmiyor: çıkarım yığınının her katmanı OpenAI, GPT-5.6 ailesinin verimlilik kazanımlarını anlatıyor ve yazının değerli kısmı model değil çıkarım yığını (inference stack). Ana tez tek cümlede: bir model yalıtılmış hâlde… OpenAI Research
- 27 Temmuz 2026 Görev geçişkenliği: işler değil, işi kimin yaptığı değişiyor OpenAI'ın ekonomi araştırması 800.000'den fazla ABD kullanıcı mesajını incelemiş. Bulgu: işle ilgili mesajların %16,8'i ve mesleğe özgü mesajların %43,5'i başka bir meslekle ilişk… OpenAI Research
- 23 Temmuz 2026 Sağlık verisini bir LLM'e bağlamak: izin, kapsam ve sınırlar ChatGPT'ye ABD'de sağlık özelliği geliyor: kullanıcı isterse Apple Health'i ve desteklenen tıbbi kayıtları güvenli biçimde bağlayabiliyor. OpenAI'ın verdiği rakama göre haftada 30… OpenAI Research
- 22 Temmuz 2026 İnternetin olmadığı yerde AI: çevrimdışı-öncelikli mimari Yazı somut bir rakamla açılıyor: Siemens'in raporuna göre Fortune 500 şirketleri plansız duruşlar yüzünden yılda tahmini 1,4 trilyon dolar kaybediyor — ve bu kayıp, sorunu hızlı t… AWS Architecture Blog
- 22 Temmuz 2026 13.917 katılımcılı bir çalışma: değerlendirmeyi nasıl kurgularsın Google Research, semptom değerlendirmesi yapan konuşma tabanlı AI prototipleriyle ulusal ölçekte bir karşılaştırmalı çalışma yürütmüş. İlgi çekici kısım tıp değil, deney tasarımı.… Google Research
- 22 Temmuz 2026 İki haftada olay-güdümlü AI asistanı: insan döngüde kalarak Pelago, madde kullanım bozukluğu desteği veren bir dijital klinik. Mühendislik ekibi, bakım ekibine önerilen değerlendirmeler üreten olay-güdümlü bir AI asistanını AWS serverless … AWS Architecture Blog
- 21 Temmuz 2026 Sandbox'tan kaçış: değerlendirme ortamı neden bir güvenlik sınırıdır OpenAI, model değerlendirmesi sırasında yaşanan bir güvenlik olayını ve Hugging Face ile yürüttüğü ortak çalışmayı duyuruyor. Olayın teknik özü şu: ExploitGym adlı değerlendirme o… OpenAI Research
- 20 Temmuz 2026 Hiçbir test paketi her davranışı öngöremez: kademeli yayına çıkmanın değeri Uzun süre çalışabilen modeller zor ve açık uçlu problemleri çözebiliyor. Ama onları faydalı kılan ısrarcılık, aynı zamanda istenmeyen eylemler için daha fazla fırsat demek — ve bu… OpenAI Research
- 17 Temmuz 2026 Netflix LLM sunumunu neden kendi işletiyor — ve hangi takasları yaptı Çoğu kurum LLM'leri barındırılan API'ler üzerinden tüketiyor. Netflix daha ileri gitmiş: model dağıtımından çıkarıma kadar tüm yığını kendisi işletiyor — ve bunu ayrı bir ML silos… Netflix Tech Blog
- 17 Temmuz 2026 Token başına maliyet yanlış metrik: başarılı sonuç başına maliyet Yazının merkezinde bir metrik eleştirisi var. Yıllarca yazılımın başarısı benimsenme ile ölçüldü: alınan lisans, aktif kullanıcı, yenilenen abonelik. AI'da bu yetmiyor; ölçülmesi … OpenAI Research
- 16 Temmuz 2026 Tek oturumda bitmeyen süreçler: Cars24'ün sesli ajan mimarisi Cars24, Hindistan merkezli büyük bir çevrimiçi araç alım-satım platformu. Problem tanımı ilginç: geleneksel e-ticaretin aksine Hindistan'da araç alıp satmak nadiren tek bir oturum… OpenAI Research
- 16 Temmuz 2026 Asıl fark yetenek değil bağlam: bir tasarımcının Codex deneyimi OpenAI'ın kendi kullanım örneklerinden biri: Creative Specialist Chad Nelson, kod yazmayan biri olarak Codex'i bir yaratıcı problem çözücü gibi kullanıyor. Eskizler, storyboard'la… OpenAI Research
- 15 Temmuz 2026 Otomatik kırmızı takım: prompt enjeksiyonuna karşı düşmanca eğitim Kırmızı takım (red-teaming) çalışması, modellerdeki açıkları bulmak için şart — ama insan gücüyle ölçeklenmiyor ve bir darboğaz oluşturuyor. Üstelik yaygın kullanılan sağlamlık de… OpenAI Research
- 14 Temmuz 2026 Token fiyatı %97 düştü ama fatura büyüyor: farklı irtifalardan bakmak Rakamlar çarpıcı: GPT-4'ten GPT-5.4'e milyon token başına fiyat %97 düşmüş. GPT-5.6 ise kodlama ajanı endeksinde daha iyi performansı %54 daha az çıktı token'ı ve görev başına %57… OpenAI Research
- 8 Temmuz 2026 Bozuk benchmark: testin kendisini denetlemek Model yeteneklerini doğru ölçmek, dağıtım ve güvenlik kararları için kritik. Değerlendirmelerin kusurlu olması sadece bir sayıyı bozmaz — yetenekler hakkında yanlış bir anlayış ya… OpenAI Research
- 7 Temmuz 2026 4 saatlik mutabakat incelemesi 30 dakikaya: log izinde zaman damgası tutarsızlığı Australian Payments Plus (AP+) Avustralya'da ödeme ve kimlik altyapısı işletiyor. Ekipleri şema kuralları, teknik spesifikasyonlar, üye yükümlülükleri, operasyonel süreçler, siber… OpenAI Research