Incident Yönetimi
Incident, müşteri etkisi yaratan veya kritik sistemleri riske atan üretim sorunlarıdır. Hedefimiz: etkiyi hızlı azaltmak, iletişimi şeffaf tutmak ve tekrarını önlemek.
SEV Seviyeleri
| SEV | Tanım | Örnek |
|---|---|---|
| SEV1 | Geniş müşteri etkisi / kritik fonksiyon çalışmıyor | Giriş yapılamıyor, ödeme alınamıyor |
| SEV2 | Kısmi etki / önemli performans düşüşü | Belli bölgede yavaşlık, kısmi kesinti |
| SEV3 | Sınırlı etki / workaround var | Tek müşteri etkisi, geçici çözüm mevcut |
Roller
- Incident Commander (IC): süreci yönetir, önceliği belirler
- Tech Lead: teknik tanı ve çözüm yollarını koordine eder
- Comms: iç/dış iletişim mesajlarını hazırlar
- Scribe: zaman çizelgesi ve karar kayıtlarını yazar
Müdahale Akışı
- Declare: SEV belirle, kanal aç, rolleri ata
- Triage: semptom → olası neden → hızlı doğrulama
- Mitigate: etkiyi azalt (rollback, feature flag off, kapasite)
- Resolve: kalıcı çözüm ve doğrulama
- Postmortem: kök neden + aksiyonlar + takip
Önce etkiyi azalt, sonra kök nedeni derinlemesine ara. Incident sırasında ‘haklı çıkmak’ değil ‘hizmeti geri getirmek’ önceliktir.
