Утро вторника. В 09:41 в интернет-магазине зависает оплата. В 09:48 приходит первое "не могу оплатить". К 10:20 обращений уже сорок семь, два оператора отвечают по-разному, а директор узнаёт о сбое от знакомого.
Тут обычно начинают искать, кто виноват. Но виноватых нет, просто нет процесса. Дальше – как то же самое утро проходит у команды, у которой процесс есть. Спойлер: для этого не нужны ни отдел, ни бюджет.
Вот главное переключение, которое надо сделать в голове.
Обращение – это разговор с одним человеком. Сбой – одно событие, задевшее многих. Пока вы работаете с сорока семью обращениями, вы сорок семь раз расследуете одно и то же и столько же раз по-разному объясняете. Объявите один инцидент с номером – и дальше работайте с ним.
Робот замечает падение за минуту. Первый клиент напишет минут через десять и уже раздражённым. Вот эти девять минут и решают всё: когда приходит первое сообщение, у вас уже готов ответ.
Технически достаточно внешнего мониторинга с тревогой в мессенджер. Важна одна деталь: сигнал должен сразу становиться инцидентом с номером. "Инцидент SITE-3, открыт в 09:42" – с этим можно работать. "Ребята, кажется, упало" – это не событие, это реплика в чате.
Новые обращения цепляются к инциденту. Не сорок семь расследований, а сорок семь пострадавших от одного события. Операторы отвечают одним текстом, и у всех клиентов одна версия происходящего.
А когда починили, не надо вспоминать, кто там писал: всем уходит одно "готово, работает, извините". Вот это, кстати, клиенты запоминают сильнее всего. Не то, что вы починили, а то, что про них не забыли.
Публичная статус-страница снимает основной поток паники. Что работает, что чиним, когда обновляли. Жёлтая плашка "чиним, обновлено 09:44" удерживает человека лучше, чем зелёная надпись "всё в порядке", в которую он уже не верит. И заодно она отсекает часть обращений: увидел, что вы в курсе, – не написал.
Вопрос "кто сейчас за это отвечает" должен иметь ответ до сбоя, а не после.
Минимальная схема живёт даже в команде из двух человек: дежурный недели, которому летит первый сигнал, плюс одно правило – не отреагировал за пять минут, сигнал уходит следующему сам. Ночная авария перестаёт быть выбором между "все спят" и "подняли всех".
Инцидент закрыт не когда починили, а когда ответили на три вопроса: почему сломалось, почему узнали поздно, что меняем.
И одно железное правило: без фамилий. Ищем дырку в процессе, а не виноватого. Стоит один раз назначить крайнего – и следующего честного разбора у вас не будет, будет отчёт для начальства. Выводы кладите в базу знаний, оттуда они превращаются в готовый ответ, и похожий случай закрывается за минуту.
09:41 оплата падает. 09:42 мониторинг открыл инцидент, дежурному ушёл сигнал. 09:44 на статус-странице "чиним", у операторов готовый ответ. 09:48 первое обращение, ответ за двадцать секунд. Всего обращений будет три, а не сорок семь. 10:22 починили, всем троим ушло "готово". В четверг двадцать минут разбора и короткая статья в FAQ.
Та же авария, другое утро. И ничего дорогого: ни выделенной команды, ни дашбордов во всю стену. Пять привычек, которые заводятся за неделю.