Ana içeriğe atla

Incident Yönetimi

Incident, müşteri etkisi yaratan veya kritik sistemleri riske atan üretim sorunlarıdır. Hedefimiz: etkiyi hızlı azaltmak, iletişimi şeffaf tutmak ve tekrarını önlemek.

SEV Seviyeleri

SEVTanımÖrnek
SEV1Geniş müşteri etkisi / kritik fonksiyon çalışmıyorGiriş yapılamıyor, ödeme alınamıyor
SEV2Kısmi etki / önemli performans düşüşüBelli bölgede yavaşlık, kısmi kesinti
SEV3Sınırlı etki / workaround varTek müşteri etkisi, geçici çözüm mevcut

Roller

  • Incident Commander (IC): süreci yönetir, önceliği belirler
  • Tech Lead: teknik tanı ve çözüm yollarını koordine eder
  • Comms: iç/dış iletişim mesajlarını hazırlar
  • Scribe: zaman çizelgesi ve karar kayıtlarını yazar

Müdahale Akışı

  • Declare: SEV belirle, kanal aç, rolleri ata
  • Triage: semptom → olası neden → hızlı doğrulama
  • Mitigate: etkiyi azalt (rollback, feature flag off, kapasite)
  • Resolve: kalıcı çözüm ve doğrulama
  • Postmortem: kök neden + aksiyonlar + takip

Önce etkiyi azalt, sonra kök nedeni derinlemesine ara. Incident sırasında ‘haklı çıkmak’ değil ‘hizmeti geri getirmek’ önceliktir.