Уведомления и реагирование
Система сообщает о сбоях и заполнении дисков, мы реагируем и устраняем причину. Опыт показывает: заполненный диск — одна из самых частых и самых легко предупреждаемых проблем.
Контролируем состояние серверов, виртуальных машин и сети — и сообщаем о проблемах до того, как их заметит бизнес. Работаем в Москве и Московской области — большинство задач решаем удалённо.
Проблемы в инфраструктуре редко приходят внезапно: диск заполнялся неделями, копия не выполнялась с четверга, сервис по ночам перезапускался. Внезапной становится только остановка работы. Наблюдение превращает такие вещи в события с датой и причиной — вместо «вчера ещё работало».
Работает это только вместе с реакцией: оповещение, на которое никто не отвечает, — просто уведомление о будущем сбое. Поэтому контроль и реагирование — одна услуга, а не две.
Список метрик — не цель сама по себе: контролируем то, по чему можно действовать, — от доступности сервисов до свободного места на дисках.
Метрики в списке — рабочий минимум, а не потолок: к ним добавляется всё, что важно конкретной компании — от состояния отдельного сервиса до свободного места в конкретном хранилище.
Система сообщает о сбоях и заполнении дисков, мы реагируем и устраняем причину. Опыт показывает: заполненный диск — одна из самых частых и самых легко предупреждаемых проблем.
Разворачиваем и обслуживаем Zabbix и аналогичные системы мониторинга: настройка метрик — разовая работа, но система мониторинга тоже требует обслуживания.
Выполнение резервного копирования — тоже метрика: пропущенная копия видна в тот же день, а не в момент, когда понадобится восстанавливаться.
Оповещение приходит, когда значение переходит порог: место заканчивается, сервис недоступен, машина не отвечает. Пороги настраиваются под инфраструктуру — чтобы не шуметь и не молчать.
Порядок такой: метрики → пороги → оповещения → реакция. Пропуск любого звена лишает смысла остальные.
Метрики показывают, что случилось; журналы — почему. События syslog с MikroTik и серверов можно собрать в одной точке рядом с мониторингом: тогда при сбое видна не только метрика, но и хронология. Этому посвящено отдельное направление — централизованное логирование.
Базовый набор для небольшой инфраструктуры:
Набор собирается под инфраструктуру: для одной машины он короткий, для площадки с виртуализацией — шире.
Часть проблем — заполнение дисков, отвалившийся сервис, замолчавшая копия — видна до того, как остановит работу.
Рост нагрузки и заполнение хранилищ видны в динамике: расширяться можно по факту, а не по ощущению «что-то тормозит».
Состояние инфраструктуры видно постоянно, а не в момент сбоя — вместе с резервным копированием это основа плановой эксплуатации.
Роль наблюдения скромная, но фундаментальная: это глаза инфраструктуры. Обслуживание, копии и обновления работают лучше, когда состояние видно.
Сначала определяем, что именно важно контролировать в вашей инфраструктуре, затем разворачиваем систему мониторинга, настраиваем метрики и уведомления и проверяем, что оповещения доходят. Мониторинг дополняет резервное копирование и регулярное обслуживание: состояние инфраструктуры видно постоянно, а не в момент сбоя.
Разворачивание — разовая работа или часть проекта по инфраструктуре; ведение мониторинга и реагирование на оповещения — часть абонентского сопровождения. После запуска смотрим на оповещения вместе с вами: что действительно важно, а что шумит.
Контроль разворачивается постепенно: сначала критичные сервисы и диски, затем остальное по мере надобности. Объём растёт вместе с инфраструктурой, а не по принципу «чем больше метрик, тем лучше».
Приходит оповещение — мы реагируем: смотрим причину и устраняем её. Часть проблем решается до того, как их заметят сотрудники. Ложные оповещения настраиваем, чтобы не повторялись: мониторинг, который кричит по мелочи, быстро перестают слушать.
Обычно Zabbix или аналогичная система — выбираем под инфраструктуру, а не наоборот. Для компании при этом важнее другое: что именно видно и на что реагируют.
Особенно тогда: у единственного сервера нет запасного, поэтому о его состоянии важно узнавать заранее. Настроить контроль одного сервера — небольшая задача.
Да, панель мониторинга — часть системы, доступ к ней можно дать и вашим специалистам. Порядок доступа обсуждаем при настройке.
Нет, это инструмент: мониторинг сообщает о проблеме, а устраняет её обслуживание. Работают они только вместе — по отдельности это полумеры.
На инфраструктуре компании: разворачиваем на вашем сервере — физическом или виртуальной машине. Это ваша система и ваши данные, доступ к панели можно дать своим специалистам.
Резервное копирование и восстановление, серверы и инфраструктура, системное администрирование. Все направления — в разделе «Услуги».
Во что обходится час, пока сбой никто не заметил, — прикиньте в калькуляторе стоимости простоя.
Расскажите, что нужно настроить, модернизировать или взять на обслуживание. Предложим подходящий вариант реализации.