Infrastructure monitoring

Інфраструктурні alert-и, які поважають severity

Підключіть моніторинг інфраструктури (Prometheus, Zabbix, Uptime Kuma, custom) у WardenPoint. Severity визначає канал; лейбли — одержувача; resolve-hooks скасовують ланцюг.

Multi-source intake Маршрутизація з урахуванням лейблів Resolve-hook скасовує

Як виглядає спокійний день

  1. 10:00
    Prometheus
    Warning: node memory 78% на app-03
  2. 10:00
    WardenPoint
    Telegram message у канал ops · без ескалації
  3. 14:21
    Prometheus
    Resolved · memory повернувся до baseline
  4. 14:21
    WardenPoint
    Журнал аудиту позначає 'resolved' · без подальших відправлень

Де infra-команди страждають

Біль infra-моніторингу

Три скарги від інфраструктурних команд, чиї alerts будять людей з неправильних причин.

Кожен alert будить чергового

Без маршрутизації з урахуванням severity warning-alerts будять людей через не-інциденти.

Fix

Мапте severity на канал: warning у чат, critical на голос. Severity — єдиний регулятор.

Flapping-монітори створюють шторми

Нестабільна нода відправляє alert/resolve/alert/resolve, доки хтось вручну не вимкне.

Fix

Дедуплікуємо за (source, key). Ідентичні alerts у вікні зливаються в одне сповіщення з лічильником.

Немає способу заглушити per host-group

Коли кластер на maintenance, alerts звідти не повинні нікого будити.

Fix

Maintenance-вікна заглушують за дочепленими лейблами. Поставте TTL — нормальна маршрутизація відновиться автоматично.

Політика ескалації

Рецепт: маршрутизація з урахуванням severity

Три рівні severity, три різні шляхи. Налаштуйте один раз, використовуйте скрізь.

  1. 1
    На хвилині
    0:00

    Critical → головного чергового голосом

    Severity = critical — негайний дзвінок плюс повідомлення в Telegram. Падіння кластера, проблеми з платежами, простій, що зачіпає клієнтів.

    voice_calltelegram_voice
  2. 2
    На хвилині
    0:00

    Warning → ops chat

    Severity=warning потрапляє у Telegram-чат ops. Нікого не будить; наступна зміна розбереться.

    telegram
  3. 3
    На хвилині
    0:05

    Critical без підтвердження → резервний

    Якщо п'ять хвилин без підтвердження, резервний черговий отримує дзвінок.

    voice_call
  4. 4
    На хвилині
    0:00

    Info → email digest

    Info-level alerts зливаються у щоденний email-дайджест. Корисно для трендів, не для дії.

    email

Звідки приходять alerts

Часті infra-джерела

Що б ви не використовували, WardenPoint прийме webhook.

Що зміниться

Що infra-команди звітують

Сон повертається для warnings

Warning-level alerts ідуть з телефона чергового у чат. Якість сну покращується.

Dedup приборкує flap-шторми

Ідентичні alerts зливаються. Post-mortems більше не рахують 30 викликів на один інцидент.

Maintenance чесний

Maintenance-вікна заглушують за лейблами. Ніхто не вибачається за виклик під час планового простою.

FAQ infra

Питання інфраструктурних команд

Хешуємо (source, alertname, labels) і трактуємо повтори у налаштовуваному вікні як той самий інцидент. Журнал аудиту тримає лічильник; ланцюг запускається лише для першого.
Безкоштовний план

Зробіть infra-alerts чутливими до severity

Підключіть одне джерело Prometheus або Zabbix, задайте маршрутизацію за severity й подивіться, як наступний warning потрапить у чат — а не в спальню.

  • Маршрутизація за severity
  • Dedup за хешем
  • Maintenance-вікна