Infrastructure monitoring

Alerty infrastruktury, które respektują severity

Wepnij monitoring infrastruktury (Prometheus, Zabbix, Uptime Kuma, custom) w WardenPoint. Severity decyduje o kanale; etykiety — o dyżurnym; resolve-hooki anulują łańcuch.

Multi-source intake Trasowanie z uwzględnieniem etykiet Resolve-hook anuluje

Jak wygląda spokojny dzień

  1. 10:00
    Prometheus
    Warning: node memory 78% na app-03
  2. 10:00
    WardenPoint
    Telegram message do kanału ops · bez eskalacji
  3. 14:21
    Prometheus
    Resolved · pamięć wróciła do baseline
  4. 14:21
    WardenPoint
    Dziennik audytu oznacza 'resolved' · bez dalszych wysyłek

Gdzie boli zespoły infra

Ból infra monitoringu

Trzy zarzuty od zespołów infrastruktury, których alerty budzą ludzi z błędnych powodów.

Każdy alert budzi dyżurnego

Bez routingu z uwzględnieniem severity warning-alerty budzą ludzi przez nie-incydenty.

Fix

Mapuj severity na kanał: warningi do czatu, criticale na głos. Severity to jedyne pokrętło.

Flapujące monitory tworzą sztormy

Niestabilny node odpala alert/resolve/alert/resolve, dopóki ktoś ręcznie nie wyciszy.

Fix

Dedupujemy po (source, key). Identyczne alerty w oknie zwijają się w jedno powiadomienie z licznikiem.

Brak sposobu wyciszenia per host-group

Gdy klaster jest w maintenance, alerty z niego nie powinny nikogo budzić.

Fix

Okna maintenance wyciszają po dopasowaniu etykiet. Ustaw TTL, a normalne trasowanie wróci automatycznie.

Polityka eskalacji

Przepis: trasowanie z uwzględnieniem severity

Trzy poziomy severity, trzy różne ścieżki. Skonfiguruj raz, używaj wszędzie.

  1. 1
    W minucie
    0:00

    Critical → głównego dyżurnego przez głos

    Severity = critical — natychmiastowy telefon plus wiadomość Telegram. Awaria klastra, problemy z płatnościami, przerwa odczuwalna przez klientów.

    voice_calltelegram_voice
  2. 2
    W minucie
    0:00

    Warning → czat ops

    Wpisy o severity = warning lecą na czat operacyjny Telegram. Nikogo nie budzą; ogarnia je następna zmiana.

    telegram
  3. 3
    W minucie
    0:05

    Critical bez potwierdzenia → zapasowy

    Jeśli przez pięć minut brak potwierdzenia, zapasowy dyżurny dostaje połączenie.

    voice_call
  4. 4
    W minucie
    0:00

    Info → email digest

    Alerty info-level zwijają się w dzienny digest mailowy. Przydatne do trendów, nie do akcji.

    email

Skąd alerty przychodzą

Częste źródła infra

Cokolwiek prowadzisz, WardenPoint przyjmie webhook.

Co się zmieni

Co zespoły infra raportują

Sen wraca przy warningach

Alerty na poziomie warning schodzą z telefonu dyżurnego na czat. Jakość snu rośnie.

Dedup tłumi flap-sztormy

Identyczne alerty zwijają się. Post-mortemy nie liczą 30 wezwań na jeden incydent.

Maintenance jest uczciwy

Okna maintenance wyciszają po etykiecie. Nikt nie przeprasza za budzenie podczas planowanej przerwy.

FAQ infra

Pytania zespołów infrastruktury

Hashujemy (source, alertname, labels) i traktujemy powtórki w konfigurowalnym oknie jako ten sam incydent. Dziennik audytu trzyma licznik; łańcuch uruchamia się tylko dla pierwszego.
Plan darmowy

Spraw, by alerty infra szanowały severity

Podłącz jedno źródło Prometheus lub Zabbix, zdefiniuj trasowanie po severity i obserwuj, jak następny warning ląduje na czacie — nie w sypialni.

  • Trasowanie po severity
  • Dedup po hashu
  • Okna maintenance