Метрики и полосатый жираф

Пару недель назад листал старую детскую энциклопедию и наткнулся на главу про маскировку у животных. С детства я знал, что тигру нужны полоски для маскировки. Этого факта было достаточно. Почему тигр оранжевый и зачем ему именно полоски, я как-то не задумывался.

Оказалось, что тигр охотится среди деревьев во время рассвета и на закате, когда деревья бросают чёрные длинные тени на оранжевую от солнца землю. Днём, когда тени не такие длинные, а солнце не оранжевое, тигр спит. Именно поэтому у него такой окрас.

После прочитанного в голове вместо голого факта возникла система. Принцип этой системы можно расширить на других животных. Например, жираф питается листьями деревьев, поэтому его маскировка состоит из пятен, которые похожи на тень от листвы. А у львицы нет полосок и пятен, потому что она охотится на открытой местности в выжженной траве саванны.

И тигр, и жираф, и лев умею успешно маскироваться. Они обитают в разных условиях и поэтому используют разную окраску. Кажется глупым и бессмысленным оценивать маскировку льва по количеству пятен. Но большинство компаний поступают именно так, когда речь заходит о метриках.

В компании, где я работал, ввели метрику "процент багов на проде" и установили допустимый диапазон. За превышение диапазона — санкции. Метрику спустили в команды и началось: часть багов с прода фиксили втихаря без заведения в джире, часть — заводили как таску, а не баг.

Введённая метрика не учитывала различия контекстов. Например, наша команда была завязана на внешние интеграции, которые не предоставляли тестовые среды, а наши пользователи работали на устройствах, которых не было в команде тестирования. У тестировщиков не было ни инструментов, ни полномочий, чтобы уменьшить процент багов с прода. Всё, что им оставалось — это жульничать.

Метрику использовали для давления, а не для изучения системы. Она создала дополнительный стресс и усложнила коммуникацию. Команды так и не избавились от тех системных ограничений, которые заставляли их тестировать на проде. Метрика не улучшила качество, она его ухудшила.

Если хвататься за метрику как за факт и не учитывать контекст, если использовать метрику как инструмент давления, а не изучения системы, то можно нанести больше вреда, чем пользы. Интересно, если давить на жирафа за обилие пятен и отсутствие полосок, как скоро у него начнётся депрессия?