Zabbix

Мониторинг mdadm RAID в Zabbix: degraded, rebuild и состояние массива

Программный RAID mdadm может продолжать работать после отказа одного диска, поэтому пользователь долго ничего не замечает. Именно это делает degraded-массив опасным: сервисы живы, но запас отказоустойчивости уже потерян.

Что нужно отслеживать

  • все ожидаемые md-устройства существуют;
  • массив не находится в degraded-состоянии;
  • идёт ли rebuild/resync/recovery;
  • не застряла ли синхронизация;
  • сколько активных и failed devices видит mdadm;
  • нет ли новых ошибок самого диска по SMART.

/proc/mdstat — быстрый источник состояния

Файл /proc/mdstat доступен на Linux без запуска mdadm и показывает активные массивы, состояние участников и прогресс синхронизации.

cat /proc/mdstat

Его удобно использовать для общей проверки, но не стоит строить всю диагностику только на поиске строки _: форматы и типы массивов различаются, а подробное состояние лучше получать структурированным скриптом.

mdadm —detail для подробностей

Команда mdadm --detail /dev/md0 показывает State, Active Devices, Working Devices, Failed Devices и другую полезную информацию. Для Zabbix лучше завернуть нужные значения в небольшой скрипт или UserParameter, который возвращает число либо короткий статус.

Не запускайте агент от root ради одной проверки

Если конкретной команде нужны повышенные права, выдайте пользователю zabbix точечное разрешение через sudoers только на безопасную read-only команду или helper-скрипт. Не используйте безразмерное sudo ALL.

Разделите состояние массива и дисков

mdadm показывает состояние RAID, но не заменяет SMART-мониторинг. Диск может накапливать ошибки ещё до исключения из массива. Поэтому RAID health и SMART health должны быть отдельными источниками сигналов.

Какие триггеры полезны

  • массив degraded — High;
  • failed devices > 0 — High/Disaster;
  • ожидаемый массив пропал — High;
  • rebuild идёт слишком долго — Warning/High;
  • нет свежих данных от проверки — отдельный alert.

Итог: хороший мониторинг mdadm должен заметить потерю избыточности раньше человека. Проверяйте сам массив, прогресс recovery и здоровье физических дисков отдельно — тогда degraded RAID не будет месяцами жить незамеченным.

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *