Большинство заказчиков путают KPI с процессом работы, принимая еженедельный отчет о 'проделанных действиях' за показатель эффективности. В реальности работа IT-подрядчика измеряется не количеством закрытых тикетов, а стоимостью простоя бизнеса, которая для среднего предприятия составляет от 50 000 до 500 000 рублей в час.
Uptime и доступность сервисов: реальные цифры
Многие компании заявляют о доступности 99.9%, но в масштабе месяца это допускает всего 43 минуты простоя. Для критичных систем (1С, CRM, почта) это допустимый порог. Однако для периферии (принтеры, сканеры) требование 99.9% избыточно и неоправданно завышает стоимость контракта. Оптимальный стандарт для инфраструктуры малого и среднего бизнеса — 99.5% (до 3.6 часов простоя в месяц).
Кейс: компания из ритейла требовала 99.99% аптайма для всех узлов. Это привело к переплате за избыточное резервирование оборудования на 30% от бюджета. После пересмотра матрицы критичности сервисов и перехода на 99.7% для второстепенных узлов, затраты снизились без потери бизнес-эффективности.
Экспертный вывод: не требуйте 'единого процента' для всего. Разделите инфраструктуру на уровни (Tier) и установите разные KPI для ядра сети и рабочих станций.
Время реакции и время решения: ловушка SLA
Главная ошибка заказчика — контроль только времени реакции (Response Time). Реакция в 15 минут бесполезна, если время фактического решения (Resolution Time) составляет 48 часов. Для критических инцидентов (полный стоп работы офиса) норма времени реакции — до 30 минут, время решения — до 4 часов. Для низкого приоритета (замена мышки) — реакция до 4 часов, решение до 2 рабочих дней.
Пример: при использовании фиксированного абонемента подрядчики часто затягивают Resolution Time, так как им невыгодно выводить дорогого инженера на объект. Сравнение моделей оплаты в IT-аутсорсинге: фиксированный абонемент против почасовой оплаты показывает, что при почасовке скорость решения выше на 20-25%, но бюджет становится непредсказуемым.
Экспертный вывод: фиксируйте в договоре именно время решения (Resolution Time) с привязкой к финансовым штрафам (от 1% до 5% от ежемесячного платежа за каждый час просрочки).
Количество и характер инцидентов: анализ трендов
Рост количества закрытых заявок — это плохой KPI. Это значит, что инфраструктура нестабильна. Эффективный подрядчик стремится к снижению количества инцидентов за счет превентивных мер. Если количество тикетов по одной и той же проблеме (например, 'зависание терминального сервера') повторяется более 3 раз в месяц, это сигнал о необходимости модернизации, а не просто 'лечения симптомов'.
Практика показывает, что в первые 3 месяца после перехода на нового IT-подрядчика количество инцидентов растет на 15-30% из-за выявления скрытых проблем. Затем должен идти спад. Если через полгода количество заявок не снизилось — подрядчик просто 'латает дыры', не занимаясь архитектурным улучшением.
Экспертный вывод: введите метрику 'повторяющихся инцидентов'. Если доля повторяющихся проблем превышает 10% от общего объема заявок, требуйте план по устранению корневой причины (Root Cause Analysis).
Среднее время между сбоями (MTBF)
MTBF (Mean Time Between Failures) — это показатель надежности. Для сервера БД нормой считается MTBF в несколько тысяч часов. Если сервер падает раз в две недели, никакие быстрые сроки реакции не спасут бизнес от потерь. Контроль MTBF заставляет подрядчика заниматься профилактикой: обновлением прошивок, мониторингом температуры в серверной и заменой изношенных дисков до их отказа.
Кейс: внедрение мониторинга Zabbix/Nagios позволило одной из компаний-клиентов увеличить MTBF сетевого оборудования с 400 до 1200 часов за счет превентивной перезагрузки зависших коммутаторов в ночное время.
Экспертный вывод: требуйте ежемесячный отчет по MTBF для ключевых узлов. Это единственный способ понять, работает ли компания по IT-обслуживанию на опережение или просто ждет вашего звонка о поломке.
Вывод
Чтобы реально контролировать качество, откажитесь от отчетов в стиле 'обновили антивирусы' и перейдите на связку: Uptime (по уровням критичности) + Resolution Time (с жесткими штрафами) + Тренд по количеству инцидентов. Начинайте с аудита текущего состояния, чтобы не подписаться на недостижимые KPI, которые подрядчик просто проигнорирует. Избегайте компаний, которые отказываются фиксировать Resolution Time в договоре — это явный признак того, что они не уверены в своих ресурсах или компетенциях.
