Повторяющиеся уведомления в Zabbix: эскалации без спама
Повторные уведомления полезны для действительно важных проблем: например, недоступного сервера, остановившейся репликации или переполненного диска. Но если повторять каждое предупреждение каждые пять минут, Zabbix быстро превращается в генератор шума. Правильный инструмент здесь — эскалации в Action.
Как работает эскалация
В старом примере сначала создавался простой тестовый триггер, чтобы отдельно проверить саму проблему, и только потом на неё навешивалось повторяющееся действие.

Далее создаётся Action, задаются условия и операции эскалации с нужным шагом.



Операции выполняются по шагам. Первый шаг может отправить сообщение сразу, следующие — повторить его через заданный интервал или передать проблему другой группе. Повторы прекращаются, когда сценарий эскалации завершён или проблема восстановилась согласно настроенной логике действия.
Пример разумной схемы
Не все события нужно повторять одинаково. Для задач вроде продления домена можно использовать редкие ежедневные напоминания, а для ночного сбоя backup — повтор через несколько часов.


- шаг 1 — сообщение дежурному сразу;
- шаги 2–3 — повтор через 15–30 минут, если проблема остаётся;
- следующий шаг — эскалация старшему администратору;
- recovery message — сообщение о восстановлении.
Не повторяйте всё одинаково
Для информационного warning часто достаточно одного уведомления. Повторы оправданы для проблем, где без реакции растёт ущерб: отказ резервного копирования, недоступность ключевого сервиса, критический уровень свободного места или потеря репликации.
Учитывайте maintenance и подавленные проблемы
Перед внедрением проверьте поведение Action во время maintenance и при suppressed events. Иначе после плановых работ можно получить пачку сообщений, которые технически были отправлены по корректному сценарию, но операционно бесполезны.
Добавьте контекст в повтор
Повторное сообщение должно помогать принять решение: сколько времени проблема активна, какой host и item затронуты, текущее значение, severity и ссылка на событие. Просто повторять один и тот же текст без контекста мало полезно.
Проверьте сценарий тестовым событием
После изменения Action создайте безопасную тестовую проблему и дождитесь нескольких шагов. Проверьте время сообщений, получателей, recovery и отсутствие лишнего продолжения после восстановления.
Итог: повторные уведомления в Zabbix должны быть частью эскалации, а не попыткой отправлять одно сообщение бесконечно. Чем выше критичность проблемы, тем строже должен быть сценарий реакции и передачи ответственности.