← Все статьи

Инцидент-менеджмент без отдела инфраструктуры: процесс из пяти частей

Утро вторника. В 09:41 в интернет-магазине зависает оплата. В 09:48 приходит первое "не могу оплатить". К 10:20 обращений уже сорок семь, два оператора отвечают по-разному, а директор узнаёт о сбое от знакомого.

Тут обычно начинают искать, кто виноват. Но виноватых нет, просто нет процесса. Дальше – как то же самое утро проходит у команды, у которой процесс есть. Спойлер: для этого не нужны ни отдел, ни бюджет.

Сбой – это не сорок семь обращений

Вот главное переключение, которое надо сделать в голове.

Обращение – это разговор с одним человеком. Сбой – одно событие, задевшее многих. Пока вы работаете с сорока семью обращениями, вы сорок семь раз расследуете одно и то же и столько же раз по-разному объясняете. Объявите один инцидент с номером – и дальше работайте с ним.

Часть 1. Узнать первым

Робот замечает падение за минуту. Первый клиент напишет минут через десять и уже раздражённым. Вот эти девять минут и решают всё: когда приходит первое сообщение, у вас уже готов ответ.

Технически достаточно внешнего мониторинга с тревогой в мессенджер. Важна одна деталь: сигнал должен сразу становиться инцидентом с номером. "Инцидент SITE-3, открыт в 09:42" – с этим можно работать. "Ребята, кажется, упало" – это не событие, это реплика в чате.

Часть 2. Один инцидент вместо лавины

Новые обращения цепляются к инциденту. Не сорок семь расследований, а сорок семь пострадавших от одного события. Операторы отвечают одним текстом, и у всех клиентов одна версия происходящего.

А когда починили, не надо вспоминать, кто там писал: всем уходит одно "готово, работает, извините". Вот это, кстати, клиенты запоминают сильнее всего. Не то, что вы починили, а то, что про них не забыли.

Часть 3. Одно окно правды

Публичная статус-страница снимает основной поток паники. Что работает, что чиним, когда обновляли. Жёлтая плашка "чиним, обновлено 09:44" удерживает человека лучше, чем зелёная надпись "всё в порядке", в которую он уже не верит. И заодно она отсекает часть обращений: увидел, что вы в курсе, – не написал.

Часть 4. У сбоя должно быть имя

Вопрос "кто сейчас за это отвечает" должен иметь ответ до сбоя, а не после.

Минимальная схема живёт даже в команде из двух человек: дежурный недели, которому летит первый сигнал, плюс одно правило – не отреагировал за пять минут, сигнал уходит следующему сам. Ночная авария перестаёт быть выбором между "все спят" и "подняли всех".

Часть 5. Разбор без фамилий

Инцидент закрыт не когда починили, а когда ответили на три вопроса: почему сломалось, почему узнали поздно, что меняем.

И одно железное правило: без фамилий. Ищем дырку в процессе, а не виноватого. Стоит один раз назначить крайнего – и следующего честного разбора у вас не будет, будет отчёт для начальства. Выводы кладите в базу знаний, оттуда они превращаются в готовый ответ, и похожий случай закрывается за минуту.

То же утро, но с процессом

09:41 оплата падает. 09:42 мониторинг открыл инцидент, дежурному ушёл сигнал. 09:44 на статус-странице "чиним", у операторов готовый ответ. 09:48 первое обращение, ответ за двадцать секунд. Всего обращений будет три, а не сорок семь. 10:22 починили, всем троим ушло "готово". В четверг двадцать минут разбора и короткая статья в FAQ.

Та же авария, другое утро. И ничего дорогого: ни выделенной команды, ни дашбордов во всю стену. Пять привычек, которые заводятся за неделю.

Пульсар делает всё это за вас
Мониторинг раз в минуту, тревоги в Telegram и MAX, инциденты с номерами, статус-страница и отчёты – в одном кабинете, настройка за вечер. 14 дней бесплатно, карта не нужна.
Попробовать Пульсар
Ещё по теме: Мониторинг сайта: как узнавать о сбоях раньше клиентов · Отслеживание стабильности сервиса: пять цифр, которые стоит знать
Опубликовано 19.08.2026 · 8 мин чтения · Пульсар – мониторинг сайтов и показателей бизнеса