Мониторинг температуры в Zabbix: CPU, диски, серверы и сетевое оборудование
Температуру в Zabbix лучше мониторить не одним универсальным ключом, а через тот источник, который реально доступен на конкретном устройстве. Для Linux-сервера это могут быть hwmon и SMART, для физического сервера — IPMI, для коммутатора или ИБП — SNMP, а для специализированного оборудования — отдельный API или пользовательский item.
Сначала определите источник температуры
- CPU и системные датчики Linux — данные ОС, lm-sensors или hwmon;
- HDD/SSD — SMART или готовые шаблоны накопителей;
- серверное железо — IPMI/iDRAC/iLO;
- сетевое оборудование — SNMP;
- внешние датчики — SNMP, Modbus, HTTP API или собственный item.
Не создавайте item, пока не проверили готовый шаблон
В актуальных версиях Zabbix многие платформы уже имеют официальные templates и low-level discovery. Это удобнее ручного создания десятков элементов данных: при добавлении нового диска, интерфейса или сенсора нужные items и triggers могут появиться автоматически.
Порог должен зависеть от конкретного датчика
Нельзя ставить один порог, например 70 °C, для процессора, SSD, коммутатора и датчика воздуха. Допустимые температуры берите из документации производителя и учитывайте, что у одного устройства может быть несколько сенсоров с разным назначением.
Как избежать ложных тревог
Триггер по одному измерению часто шумит. Лучше реагировать на превышение в течение нескольких минут, среднее значение за интервал или устойчивое нахождение выше порога. Для возврата в OK полезен отдельный более низкий порог — гистерезис, чтобы событие не переключалось туда-сюда около одной границы.
Что вывести на dashboard
- текущую и максимальную температуру;
- график за сутки и неделю;
- датчики с наибольшей температурой;
- тренд роста после изменения нагрузки;
- корреляцию температуры с CPU load, fan RPM и состоянием дисков.
Если датчик иногда пропадает
Отдельно контролируйте отсутствие данных. Исчезнувший сенсор — это не температура 0 °C. Проверяйте доступность источника, права агента, SNMP/IPMI и состояние самого item, а затем уже значение температуры.
Итог: хороший мониторинг температуры — это не один красивый график, а связка корректного источника, разумных порогов, задержки от ложных всплесков и отдельного контроля потери данных.