Представьте утро вторника. В 09:41 в интернет-магазине зависает оплата. В 09:48 приходит первое "не могу оплатить". К 10:20 обращений уже сорок семь, два оператора отвечают по-разному, а директор узнаёт о сбое от знакомого.
Тут обычно начинают искать виноватого. Но виноватых нет, просто нет процесса. Ниже – как то же утро проходит у команды, у которой процесс есть. Для этого не нужен отдельный отдел.
Главное переключение, которое надо сделать в голове.
Обращение – это разговор с одним человеком. Сбой – одно событие, задевшее многих. Пока вы работаете с сорока семью обращениями, вы сорок семь раз расследуете одно и то же и столько же раз по-разному объясняете. Объявите один инцидент с номером и дальше работайте с ним.
Робот замечает падение за минуту. Первый клиент напишет минут через десять, уже раздражённым. Эти девять минут решают многое: когда приходит первое сообщение, у вас уже готов ответ.
Технически достаточно внешнего мониторинга с тревогой в мессенджер. Важна одна деталь: сигнал должен сразу становиться инцидентом с номером. "Инцидент SITE-3, открыт в 09:42" – с этим можно работать. С репликой "ребята, кажется, упало" работать нельзя.
Новые обращения цепляются к инциденту. Вместо сорока семи расследований – сорок семь пострадавших от одного события. Операторы отвечают одним текстом, и у всех клиентов одна версия происходящего.
Когда починили, не надо вспоминать, кто писал: всем уходит одно "готово, работает, извините". Клиенты запоминают, что про них не забыли.
Публичная статус-страница снимает основной поток паники. Что работает, что чиним, когда обновляли. Жёлтая плашка "чиним, обновлено 09:44" удерживает человека лучше, чем зелёная надпись "всё в порядке", в которую он уже не верит. Заодно она отсекает часть обращений: увидел, что вы в курсе, – не написал.
Вопрос "кто сейчас за это отвечает" должен иметь ответ до сбоя, а не после.
Минимальная схема живёт даже в команде из двух человек: дежурный недели, которому летит первый сигнал, плюс одно правило – не отреагировал за пять минут, сигнал сам уходит следующему. Ночная авария перестаёт быть выбором между "все спят" и "подняли всех".
Инцидент закрыт не когда починили, а когда ответили на три вопроса: почему сломалось, почему узнали поздно, что меняем.
Одно железное правило: без фамилий. Стоит один раз назначить крайнего, и следующего честного разбора у вас не будет, будет отчёт для начальства. Выводы кладите в базу знаний: оттуда они превращаются в готовый ответ, и похожий случай закрывается за минуту.
09:41 оплата падает. 09:42 мониторинг открыл инцидент, дежурному ушёл сигнал. 09:44 на статус-странице "чиним", у операторов готовый ответ. 09:48 первое обращение, ответ за двадцать секунд. Всего обращений будет три, а не сорок семь. 10:22 починили, всем троим ушло "готово". В четверг – двадцать минут разбора и короткая статья в FAQ.
Та же авария, другое утро. Пять привычек, которые заводятся за неделю.