🩸 Кровотечение

Вот, например, инженер по имени Аркадий - он отвечает за сложную инфраструктурную платформу, через которую проходит критически важный трафик компании. Продукт стратегический, от него зависит работа сотен пользователей.

И вот случается неизбежное - система падает. Аркадий мгновенно включается в процесс: лезет в логи, запускает диагностику, пытается докопаться до корня проблемы, чтобы устранить её навсегда.

Молодец Аркадий? Да нет же, совсем не молодец.

Первая задача Аркадия - не искать истину в логах, а как можно быстрее вернуть жизнь в систему. Пусть даже частично, пусть костыльно, но чтобы пользователи снова могли хоть что-то делать. Перенаправить трафик, отключить несущественные функции, снизить нагрузку - главное, чтобы сервис ожил. Полумёртвое всегда лучше, чем мёртвое.

Разбираться с причиной заражения - дело будущего. Сейчас нужно не лечить организм, а срочно остановить кровотечение. Когда система стабилизируется хотя бы временно - вот тогда можно копаться в коде, разбирать инцидент и устраивать постмортем.

В управлении действуют те же принципы. Когда разваливается проект, ломается коммуникации или расходится команда, бесполезно искать виновных, пока не предприняты шаги по остановке крови. Если не закрыть потерянную позицию, не собрать антикризисный созвон, не объясниться с клиентом - всё окончательно разрушится.

Сначала стабилизируй ситуацию. Даже если это временный костыль в атмосфере хаоса, которое потом придётся переделывать. А уж потом анализируй, улучшай процессы и проводи вдохновляющие ретро о том, как "мы все выросли".

Да, звучит почти банально. Но, как показывает практика, большинство Аркадиев продолжают искать причины заражения в тот момент, когда у системы уже кровотечение.

📖 @pmbbk / #idea