Данные против интуиции
Сегодня на «Чернышевской» сломался поезд, и красная ветка метро в Петербурге фактически встала.
Для меня это было особенно неприятно: станция находится примерно в середине моего обычного маршрута. Поездка была некритичной, а давку и очереди я не люблю настолько, что скорее поменяю маршрут или вообще откажусь от поездки.
В итоге получился хороший бытовой пример того, как данные помогают принимать решения в условиях неопределённости.
Сразу после новости я ничего не делал. Пока неисправный поезд оставался на линии, система продолжала находиться под воздействием инцидента, а значит, делать уверенный прогноз было рано. За 10 минут до выхода появилась новая информация: поезд движется в сторону депо. И вот здесь уже можно было начинать оценивать сценарии.
Каскадное распространение сбоя. Локальная проблема в транспортной сети не остаётся локальной. Люди меняют маршруты, уходят на соседние станции и наземный транспорт. Поэтому «поехать с другой станции» вовсе не означает избежать проблемы. Как следствие, нагрузка не исчезает — она перераспределяется.
Взаимозависимость транспортных систем. Метро, автобусы, такси и пересадки — части одной системы. Поэтому последствия сбоя могут проявиться далеко от его первоначального места и даже на другом виде транспорта.
Задержка восстановления. Даже когда причина аварии устранена, система не приходит в норму мгновенно. Накопившиеся пассажиры уже движутся по сети, поэтому пик нагрузки может смещаться дальше от места сбоя. Технически метро уже работает, а пассажиропоток ещё какое-то время восстанавливается.
Перераспределение спроса. Я предположил, что участок ближе к месту аварии после восстановления движения может, наоборот, временно оказаться более свободным. Часть людей уже изменила маршрут, кто-то отложил поездку, кто-то вообще от неё отказался. Так и получилось: до нужной точки я ехал практически в пустом вагоне, хотя интервалы между поездами всё ещё были больше обычных.
Но самое интересное здесь — байесовский вывод.
Я не сделал один прогноз и не стал ему слепо следовать.
Каждый новый факт менял оценку ситуации: поезд сломан, линия стоит > ехать, скорее всего, плохая идея поезд движется в депо > вероятность восстановления движения выросла. Дальше добавились время до моего выхода, расположение депо, ситуация на других станциях и ожидаемое перераспределение пассажиров.
То есть: гипотеза > новые данные > обновлённая оценка > решение.
И ещё важна стоимость ошибки. Отказаться от этой поездки для меня почти ничего не стоило. Попасть в давку — неприятный исход. Поэтому решение нужно принимать не только по вероятности события, но и с учётом последствий ошибки.
В какой-то момент сердце говорило: «Не едь, там будет мрачная давка и мало воздуха».
А анализ говорил: «Скорее всего, ты поедешь в полупустом вагоне».
На этот раз анализ оказался прав. Почему я вообще об этом пишу?
Потому что примерно этим мы занимаемся в BIGDATAHOUSE.
Только вместо сломанного поезда могут быть продажи, остатки, устройства, логистика, производство или поведение клиентов, погода и Северный морской путь. - Есть событие. - Есть связанные процессы. - Есть временные лаги. - Есть перераспределение потоков. - Есть новые данные. И есть необходимость принять решение до того, как станет очевидно, что произошло.
Работа с данными это не сколько графики и дашборды, а скорее попытка ответить на три вопроса: - Что происходит сейчас? - Что, вероятнее всего, произойдёт дальше? - И какое решение имеет смысл принять с учётом стоимости ошибки?
Иногда это экономит бизнесу миллионы, а иногда просто позволяет принять решение ничего не делать и проехать через Петербург в пустом вагоне метро.