Alerty w Slacku są ignorowane
Dyżurni inżynierowie wyłączają powiadomienia Slacka w nocy. Krytyczne alerty topią się w szumie kanałów i przekraczają SLA.
Fix
Krytyczne severity idzie na telefon + Telegram głos. Slack zostaje kanałem informacyjnym.
Kieruj alerty monitoringu (Grafana, Prometheus, Sentry, Uptime Kuma) do dyżurnego inżyniera przez Telegram, połączenia głosowe i SMS. Potwierdzenie zamyka łańcuch; resolve hook go anuluje. Przekazanie urlopowe i tygodniowe ciche godziny chronią czas dyżurnego bez gubienia priorytetu krytycznego.
Dzień z życia
Gdzie boli zespoły
Trzy najczęstsze zarzuty od zespołów inżynierskich przesiadających się na WardenPoint.
Dyżurni inżynierowie wyłączają powiadomienia Slacka w nocy. Krytyczne alerty topią się w szumie kanałów i przekraczają SLA.
Fix
Krytyczne severity idzie na telefon + Telegram głos. Slack zostaje kanałem informacyjnym.
Wiele zespołów kupuje PagerDuty dla jednej funkcji i płaci za pełen incident-management, którego nie używa.
Fix
Wybierz tylko warstwę alertowania. WardenPoint integruje się z Twoim ITSM, jeśli go masz.
Skrypty typu „ad hoc” służące do ponownego wysyłania i wywołania stronicowania przeradzają się w niesprawdzony gąszcz kodu. Przestają działać, gdy zmienia się harmonogram dyżurów.
Fix
Deklaratywne łańcuchy eskalacji. Rotacja to dane, nie kod; testowana w CI.
Polityka eskalacji
Polityka, która pasuje większości zespołów inżynierskich. Potwierdzenie na dowolnym kroku anuluje resztę.
Primary dyżur dostaje wiadomość głosowa w Telegramie. Tanio, szybko, omija DND.
Prawdziwy PSTN call na telefon primary. DTMF 1 potwierdza.
Secondary dyżur dostaje call. Email ląduje na liście dystrybucyjnej zespołu dla świadomości sytuacyjnej.
Manager inżynierów dostaje call. Pipa jest pusta, jeśli nikt nie potwierdził w SLA.
Twoje narzędzia
Te źródła alertów DevOps najczęściej podpinają.
Co się zmieni
Krytyczne severity uderza w głos; warningi zostają w czacie. Telefony spadają do alertów rzeczywiście wymagających człowieka.
Każda operacja typu „alert” generuje wpis w dzienniku audytowym zawierający informacje o podmiocie, kanale i statusie. Raporty podsumowujące powstają praktycznie same.
Zastąp cron-skrypty, hacki Slacka i częściowe konfigi PagerDuty jedną deklaratywną polityką.
FAQ DevOps
Podłącz jeden alert Grafana, ustaw 4-krokowy łańcuch i wyślij fake firing. Bez karty, bez zobowiązań.