Alarm yorgunluğunu çözmek: önce filtrele, sonra önceliklendir
Prioritize your AWS Health alerts using AWS User Notifications · Naga Bhargav
AWS Health her servis, her hesap ve her bölge için olay üretiyor: devam eden sorunlar, planlı değişiklikler, hesap bildirimleri ve kullanımdan kaldırma uyarıları — hepsi tek bir ayrışmamış akışta. Bir operasyon ekibi için bu tanıdık bir problem yaratıyor.
Yazının problem tanımı çok net: ya her bildirimi acil sayarsın ve istenmeyen bir triyaj gürültüsüyle boğulursun, ya da onları görmezden gelmeye başlarsın ve önemli olanı kaçırma riskini alırsın. Her iki yol da daha yavaş tepki süresine ve istenmeyen eskalasyonlara çıkıyor.
Sorunun kökeni önem derecelerinin farklı olması değil, hepsinin aynı kanaldan gelmesi. Bir operasyonel arıza, bir planlı bakım penceresi ve gelen kutusunda kaybolmuş bir kullanımdan kaldırma uyarısı çok farklı sonuçlar doğurur — ama aynı görünürler.
Çözümün tasarım ilkesi bir cümlede özetlenmiş: önce filtrele, sonra önceliğe göre ayır. İlk katman gürültüyü eliyor — olay kuralları yalnızca kurumun bağımlı olduğu servisler için eşleşiyor, geri kalan her şey gelen kutusuna ulaşmadan susturuluyor. İkinci katman kalanları aciliyete göre ayrı yapılandırmalara bölüyor.
Öne çıkanlar
- Alarm yorgunluğu bir kişilik zaafı değil, bir tasarım kusurudur — çözümü de tasarımdadır.
- İki katmanın sırası önemli: filtrelemeden önceliklendirmeye geçersen, gürültüyü de sınıflandırmakla uğraşırsın.
- "Sessize alma" bilinçli bir karar olarak tasarlanmış; kazara görmezden gelmekle aynı şey değil.
- Farklı öncelikler farklı teslim kanallarına gidiyor — acil olan e-postaya değil çağrıya düşmeli.
Neden önemli?
Bir alarm sisteminin başarısı, ürettiği alarm sayısıyla değil, alarma verilen tepki oranıyla ölçülür. Kimsenin bakmadığı bir gösterge paneli ya da herkesin sustuğu bir kanal, hiç olmamasından daha kötüdür: koruma yanılsaması yaratır. Bu yazının verdiği iki katmanlı desen, her izleme sisteminde uygulanabilir.
Sende karşılığı
Bu prensibi kendi projelerinde bugün uygulayabilirsin. Bir alarm kurarken şu soruyu sor: bu tetiklendiğinde gece 3'te kalkar mıyım? Cevap hayırsa bu bir alarm değil, bir metriktir — panele koy, bildirime bağlama. KlioAI'da hata izleme kurduysan (Sentry vb.), muhtemelen zaten gürültüden bunalmışsındır; çözüm daha az hata yakalamak değil, hataları sınıflandırmak: kullanıcıyı engelleyenler ayrı kanala, geri kalanı haftalık özete. Aynı disiplin CI/CD için de geçerli — sürekli kırmızı yanan bir test paketi, hiç test olmamasıyla aynı bilgiyi taşır.
Sözlük
- alert fatigue alarm yorgunluğu
- Çok fazla bildirim yüzünden ekiplerin alarmlara duyarsızlaşması; kritik uyarıların kaçırılmasına yol açar.
- triage triyaj
- Gelen olayları aciliyet ve etkiye göre sınıflandırıp önceliklendirme.
- escalation eskalasyon
- Çözülemeyen bir olayın daha üst yetki ya da uzmanlığa aktarılması.