DevOps

Eskalacja dyżur zbudowana dla zespołów inżynierskich

Kieruj alerty monitoringu (Grafana, Prometheus, Sentry, Uptime Kuma) do dyżurnego inżyniera przez Telegram, połączenia głosowe i SMS. Potwierdzenie zamyka łańcuch; resolve hook go anuluje. Przekazanie urlopowe i tygodniowe ciche godziny chronią czas dyżurnego bez gubienia priorytetu krytycznego.

API -po pierwsze Webhook przyjmowanie Identyfikatory UUID

Dzień z życia

  1. 00:12
    Grafana
    p99 checkout latency powyżej SLO przez 5 min · firing
  2. 00:14
    WardenPoint
    Telegram: głos i połączenie do głównego dyżurnego
  3. 00:18
    Inżynier
    Potwierdzenie z Telegrama · łańcuch anulowany · runbook otwarty
  4. 00:42
    Grafana
    Alert rozwiązany · w dzienniku audytowym zapisano „rozwiązany”

Gdzie boli zespoły

Ból DevOps — i co zmieniamy

Trzy najczęstsze zarzuty od zespołów inżynierskich przesiadających się na WardenPoint.

Alerty w Slacku są ignorowane

Dyżurni inżynierowie wyłączają powiadomienia Slacka w nocy. Krytyczne alerty topią się w szumie kanałów i przekraczają SLA.

Fix

Krytyczne severity idzie na telefon + Telegram głos. Slack zostaje kanałem informacyjnym.

PagerDuty jest ciężki

Wiele zespołów kupuje PagerDuty dla jednej funkcji i płaci za pełen incident-management, którego nie używa.

Fix

Wybierz tylko warstwę alertowania. WardenPoint integruje się z Twoim ITSM, jeśli go masz.

Eskalacja w shell-skryptach

Skrypty typu „ad hoc” służące do ponownego wysyłania i wywołania stronicowania przeradzają się w niesprawdzony gąszcz kodu. Przestają działać, gdy zmienia się harmonogram dyżurów.

Fix

Deklaratywne łańcuchy eskalacji. Rotacja to dane, nie kod; testowana w CI.

Polityka eskalacji

Recipe: eskalacja produkcyjnego dyżur

Polityka, która pasuje większości zespołów inżynierskich. Potwierdzenie na dowolnym kroku anuluje resztę.

  1. 1
    W minucie
    0:00

    Telegram głos do primary

    Primary dyżur dostaje wiadomość głosowa w Telegramie. Tanio, szybko, omija DND.

    telegram_voice
  2. 2
    W minucie
    0:03

    Telefon do primary

    Prawdziwy PSTN call na telefon primary. DTMF 1 potwierdza.

    voice_call
  3. 3
    W minucie
    0:08

    Telefon do secondary

    Secondary dyżur dostaje call. Email ląduje na liście dystrybucyjnej zespołu dla świadomości sytuacyjnej.

    voice_callemail
  4. 4
    W minucie
    0:15

    Wybudź managera

    Manager inżynierów dostaje call. Pipa jest pusta, jeśli nikt nie potwierdził w SLA.

    voice_calltelegram_voice

Twoje narzędzia

Podłącz do tego, co już używasz

Te źródła alertów DevOps najczęściej podpinają.

Co się zmieni

Co powinieneś zobaczyć po przesiadce

Pobudki tylko zasadne

Krytyczne severity uderza w głos; warningi zostają w czacie. Telefony spadają do alertów rzeczywiście wymagających człowieka.

Oś czasu gotowa na audit

Każda operacja typu „alert” generuje wpis w dzienniku audytowym zawierający informacje o podmiocie, kanale i statusie. Raporty podsumowujące powstają praktycznie same.

Mniej powierzchni alertowej

Zastąp cron-skrypty, hacki Slacka i częściowe konfigi PagerDuty jedną deklaratywną polityką.

FAQ DevOps

Odpowiedzi na pytania inżynierów

Zastępuje to dotychczasowy interfejs do zarządzania alertami i eskalacjami. Pakiety do zarządzania incydentami (analizy po zdarzeniu, procedury operacyjne, strony statusowe) znajdują się w innych miejscach — zamieszczamy linki do Państwa rozwiązań w dzienniku audytowym.
Plan darmowy

Przetestuj pierwszą politykę dyżur dziś po południu

Podłącz jeden alert Grafana, ustaw 4-krokowy łańcuch i wyślij fake firing. Bez karty, bez zobowiązań.

  • Plan darmowy
  • Deklaratywna polityka
  • Dziennik audytu wbudowany