Мониторинг инфраструктуры. Как избежать ошибок?

Мониторинг инфраструктуры. Как избежать ошибок?

Внедрение системы мониторинга IT-инфраструктуры часто воспринимается как обычная техническая задача. Поставил агенты, настроил оповещение и порядок. Но на практике множество компаний тратят большие деньги на инструменты, но так и не получает от них реальной отдачи, и мониторинг IT-систем оказывается неэффективным.

Все это следствие типичных ошибок, которые можно избежать, если подходить к мониторингу IT-инфраструктуры осознанно. Самая распространенная и критически важная ошибка – это попытка мониторить все подряд без какой-либо приоритетизации. Команда включает сбор метрик по каждому параметру всех устройств. В результате базы данных раздуваются, дашборды превращаются в бессмысленные простыни графиков, и администратор перестает понимать, на что вообще смотреть.

Прежде чем устанавливать мониторинг инфраструктуры, нужно определить, какие именно важные бизнес-процессы и компоненты инфраструктуры вам нужно отслеживать в первую очередь. Вторая ошибка – это игнорирование бизнес-контекста. Мониторинг IT-систем не должен сосуществовать в вакууме с загрузкой процессора 95%. Для бизнеса это сухая цифра, которая ничего не значит, пока не привязана к последствиям. Ошибка заключается в том, что инженеры настраивают пороги и алерты без учета времени суток, дней, недели, сезонности и прочих аспектов.

Мониторинг должен обязательно отвечать на вопрос, что это значит для бизнеса, а не только, чтобы именно произошло с железом. Третья распространенная проблема при внедрении системы мониторинга IT-инфраструктуры – это шумные помещения, которые приводят к игнорированию самой системы. Инженеры будут получать десятки уведомлений в час о незначительных отклонениях. Первое время они будут реагировать, но постепенно привыкают и начинают пропускать действительно важные сигналы. Для того, чтобы это исправить, нужно для каждого алерта создать условия реальной проблемы.

Полезно также использовать эскалацию. Сначала уведомления в чат, если не подтвердили через 10 минут звонок или смс. Еще одна типичная ошибка при внедрении системы мониторинга IT-инфраструктуры – это из мониторинг изолированных компонентов без понимания их зависимостей. Современные системы мониторинга дают возможность создавать сервисные карты и настраивать корреляцию событий. При правильно настроенной корреляции вы получите одно сообщение с четкой иерархией.

Также, как правило, наблюдается игнорирование логов как источника информации. Многие полагаются исключительно на числовые метрики, забывая, что логи часто содержат контекст, которого нет в метриках.

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

Back To Top