Zabbix

Мониторинг температуры в Zabbix: CPU, диски, серверы и сетевое оборудование

Температуру в Zabbix лучше мониторить не одним универсальным ключом, а через тот источник, который реально доступен на конкретном устройстве. Для Linux-сервера это могут быть hwmon и SMART, для физического сервера — IPMI, для коммутатора или ИБП — SNMP, а для специализированного оборудования — отдельный API или пользовательский item.

Сначала определите источник температуры

  • CPU и системные датчики Linux — данные ОС, lm-sensors или hwmon;
  • HDD/SSD — SMART или готовые шаблоны накопителей;
  • серверное железо — IPMI/iDRAC/iLO;
  • сетевое оборудование — SNMP;
  • внешние датчики — SNMP, Modbus, HTTP API или собственный item.

Не создавайте item, пока не проверили готовый шаблон

В актуальных версиях Zabbix многие платформы уже имеют официальные templates и low-level discovery. Это удобнее ручного создания десятков элементов данных: при добавлении нового диска, интерфейса или сенсора нужные items и triggers могут появиться автоматически.

Порог должен зависеть от конкретного датчика

Нельзя ставить один порог, например 70 °C, для процессора, SSD, коммутатора и датчика воздуха. Допустимые температуры берите из документации производителя и учитывайте, что у одного устройства может быть несколько сенсоров с разным назначением.

Как избежать ложных тревог

Триггер по одному измерению часто шумит. Лучше реагировать на превышение в течение нескольких минут, среднее значение за интервал или устойчивое нахождение выше порога. Для возврата в OK полезен отдельный более низкий порог — гистерезис, чтобы событие не переключалось туда-сюда около одной границы.

Что вывести на dashboard

  • текущую и максимальную температуру;
  • график за сутки и неделю;
  • датчики с наибольшей температурой;
  • тренд роста после изменения нагрузки;
  • корреляцию температуры с CPU load, fan RPM и состоянием дисков.

Если датчик иногда пропадает

Отдельно контролируйте отсутствие данных. Исчезнувший сенсор — это не температура 0 °C. Проверяйте доступность источника, права агента, SNMP/IPMI и состояние самого item, а затем уже значение температуры.

Итог: хороший мониторинг температуры — это не один красивый график, а связка корректного источника, разумных порогов, задержки от ложных всплесков и отдельного контроля потери данных.

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *