Editörden

Günün kapağı 32 dakikalık bir okuma ve baştan sona bir takas anlatısı: elimizdeki kuantum sonrası imza algoritması ideal değil, ama beklemenin maliyeti kullanmanın maliyetinden yüksek. Mühendislikte kararların çoğu böyledir — en iyi seçenek değil, mevcut en iyi seçenek.

Günün Kapağı
Cloudflare Blog 9 Temmuz 202632 dk okuma ileri

Mükemmeli beklemek bir strateji değil: ML-DSA ile yaşamayı öğrenmek

Why we cannot wait for better post-quantum signature algorithms · Bas Westerbaan, Christopher Patton

Onlarca yıldır güvendiğimiz RSA ve ECC, yeterince gelişmiş kuantum bilgisayarların saldırısına karşı savunmasız. Böyle bilgisayarlar henüz yok, ama beklenenden erken geliyor gibi görünüyorlar. Neyse ki çözüm hazır: kuantum saldırısına dayanıklı olacak şekilde tasarlanmış ML-KEM şifrelemesi ve ML-DSA imzalarına geçmek. İkisi de NIST tarafından, sekiz yıllık açık uluslararası bir yarışmanın ardından 2024'te standartlaştırıldı.

Şifreleme tarafında geçiş çoktan başlamış: Cloudflare'in taşıdığı trafiğin çoğunluğu şimdiden ML-KEM kullanıyor ve böylece "şimdi topla, sonra çöz" saldırılarına karşı korunuyor.

İmza tarafı ise yazının asıl konusu ve dürüst bir takas anlatısı. ML-DSA bugün standartlaştırılmış en iyi genel amaçlı kuantum sonrası imza şeması — ama dezavantajları var: ağ üzerinde çok daha büyük yer kaplıyor ve RSA/ECC ile yapabildiğimiz birçok numara ML-DSA ile yapılamıyor. Daha iyi kuantum sonrası imza şemaları var ama henüz hazır değiller.

Sonuç, başlıktaki karar: daha iyisini bekleyemeyiz. Elimizdeki kusurlu araçla geçişe başlamak, mükemmel aracı beklerken savunmasız kalmaktan iyi.

Öne çıkanlar

  • Şifreleme ve imza farklı aciliyetlerde: şifrelenmiş veri bugün toplanıp yarın çözülebilir, imza ise ancak canlıyken kırılırsa işe yarar.
  • ML-DSA'nın maliyeti boyut: daha büyük imzalar, her TLS el sıkışmasında daha fazla bayt demek.
  • NIST'in sekiz yıllık açık yarışması, kriptografik standartların nasıl kurulduğunun iyi bir örneği — kapalı kapı ardında değil, kamuya açık.
  • Cloudflare bu konuda 2021'den beri düzenli yazıyor; teknolojinin olgunlaşmasını yıllar boyunca izlemek başlı başına bir yöntem.

Neden önemli?

Mühendislikte en sık verilen yanlış karar, mükemmel çözümü beklemektir. Bu yazı karşı örneği veriyor: kusurları açıkça sayıp yine de harekete geçmek. "Şu anki en iyi seçenek nedir ve beklemenin maliyeti nedir?" sorusu, teknoloji seçimlerinin çoğunda doğru sorudur.

Sende karşılığı

Kuantum sonrası kriptografiyi bugün uygulamayacaksın, ama iki şeyi al. Birincisi karar çerçevesi: bir kütüphane ya da yaklaşım seçerken "ideal mi?" diye sorma, "beklemenin maliyeti kabul edilebilir mi?" diye sor. İkincisi somut: TLS el sıkışmasının maliyetini anlamak backend mühendisliğinin parçası. İmza boyutu büyürse el sıkışma paketleri büyür, mobil ağlarda bu ölçülebilir gecikme demektir. KlioAI mobil uygulamasında bağlantı kurma süresini ölçüyorsan, bu maliyetin nereden geldiğini bilmek işine yarar — ve bağlantı yeniden kullanımının (connection reuse) neden bu kadar önemli olduğunu açıklar.

Sözlük

ML-KEM / ML-DSA ML-KEM / ML-DSA
NIST tarafından standartlaştırılan kuantum sonrası anahtar değişimi ve dijital imza algoritmaları.
RSA / ECC RSA / ECC
Bugün yaygın kullanılan klasik açık anahtarlı kriptografi algoritmaları; yeterince güçlü kuantum bilgisayarlara karşı savunmasız.
TLS handshake TLS el sıkışması
İstemci ile sunucunun şifreli bağlantı kurmadan önce anahtar ve kimlik üzerinde anlaştığı ilk aşama.
Orijinali oku

Kısa Kısa

AWS Architecture Blog 9 Temmuz 20269 dk okuma orta

Niyeti mantıktan ayırmak: veri pipeline'larında kopyala-yapıştır tuzağı

Specification-driven composition for flexible data workflows

Veri pipeline'ları genelde basit betikler olarak başlar. Büyüdükçe dönüşüm mantığını kopyalarsın ve küçük bir değişiklik birden çok iş akışına çığ gibi yayılır. Dönüşüm mantığını betikler arasında kopyalayıp değiştirmek, ölçekte yönetilemez iş akışları üretir.

Daha sinsi bir sonuç da var: her pipeline'ın ne yaptığını takip etmek zorlaşır çünkü iş akışının niyeti kodun içine gömülüdür. Bu görünürlük eksikliği, özellikle sağlık, finans ve yaşam bilimleri gibi düzenlemeye tabi alanlarda yönetişimi zorlaştırır.

Önerilen desen spesifikasyon-güdümlü kompozisyon: iş akışının niyetini işleme mantığından ayırmak. Mantığı betiğe gömmek yerine, ne yapılacağını bildirimsel bir spesifikasyonda tanımlıyorsun; işleme motoru bunu okuyup uyguluyor. Sonuç: daha az tekrar, yeni veri kümesini devreye almanın kısalması ve iş akışları arasında tutarlılık.

  • Klasik problem: orkestrasyon, dönüşüm mantığı ve doğrulama kuralları aynı betikte iç içe. Yeni bir veri kümesi = kod değiştir ve yeniden dağıt.
  • Doğrulama çoğu zaman yalnızca işleme sırasında yapılıyor, bu yüzden sorunlar geç ortaya çıkıyor.

Sende karşılığı

Bu deseni bu gazetenin pipeline'ında zaten görebilirsin: kaynak listesi config.py içinde bildirimsel olarak duruyor, çekme mantığı ise ayrı. Yeni bir kaynak eklemek için kod değil konfigürasyon değiştiriyorsun. Aynısını DBH'daki yakıt analizi tarzı bir işte de kur: hangi kolonun nasıl temizleneceğini koda gömmek yerine bir YAML/JSON şemasında tanımla. Bir avantajı daha var — spesifikasyon varsa doğrulamayı işlemeden önce yapabilirsin, yani hatayı veriyi işlemeye başlamadan yakalarsın.

Sözlük

declarative specification bildirimsel spesifikasyon
Nasıl yapılacağını değil ne istendiğini tarif eden yapılandırma; motor gerisini halleder.
data governance veri yönetişimi
Verinin nereden geldiği, nasıl dönüştüğü ve kimin eriştiğinin izlenebilir olması.
Orijinali oku
Google Research 9 Temmuz 20266 dk okuma ileri

Bir trilyon dakikalık sensör verisiyle eğitilen temel model

SensorFM: Towards a general intelligence and interface for wearable health data

SensorFM, giyilebilir sağlık verisi için bir temel model (foundation model). Beş milyon kişiden gelen bir trilyon dakikadan fazla sensör verisiyle önceden eğitilmiş. Model boyutu ile veriyi birlikte ölçekleyerek insan fizyolojisinin genel amaçlı bir temsilini öğreniyor ve bu temsil 35 farklı sağlık tahmin görevine aktarılabiliyor.

Yaklaşımın farkı şu: etiketli veriyle görev görev eğitmek yerine, etiketsiz giyilebilir veriden nüfus ölçeğinde doğrudan öğreniyor. Sonuç, az etiketle uyarlanabilen ve eksik veriyi doldurabilen bir temsil.

Veri kümesi 100'den fazla ülkeden, Eylül 2024 – Eylül 2025 arası, verilerinin araştırmada kullanılmasına rıza göstermiş kişilerden kimliksizleştirilerek örneklenmiş.

  • "Temel model" fikri metin ve görüntüden zaman serisine taşınıyor — aynı tarif: çok veri, öz-denetimli ön eğitim, sonra göreve uyarlama.
  • 35 göreve transfer olması, temsilin göreve özel değil genel olduğunun kanıtı.

Sende karşılığı

Tradebot'ta zaman serisi verisiyle çalışıyorsun ve buradaki fikir doğrudan ilgili: öz-denetimli ön eğitim. Etiketli veri ("bu noktada al") pahalı ve azdır; etiketsiz fiyat verisi ise bol. Modeli önce etiketsiz veriyle genel bir temsil öğrenmesi için eğitip (ör. maskelenmiş bölümü tahmin etme), sonra küçük etiketli setle uyarlamak, doğrudan etiketli veriyle eğitmekten genelde daha iyi sonuç verir. PyTorch'ta bunu denemek erişilebilir bir proje — ve portföyünde "öz-denetimli ön eğitim uyguladım" demek güçlü bir cümledir.

Sözlük

foundation model temel model
Geniş ve etiketsiz veriyle önceden eğitilip birçok farklı göreve uyarlanabilen büyük model.
self-supervised pre-training öz-denetimli ön eğitim
Etiket olmadan, verinin kendisinden türetilen görevlerle (ör. eksik parçayı tahmin) model eğitme.
data infilling veri doldurma
Eksik ya da kayıp ölçümlerin model tarafından makul biçimde tamamlanması.
Orijinali oku