DIM: что платформа знает о сбое заранее

Одна и та же задержка данных может быть допустимой для внутреннего отчета и критичной для операционного сервиса или регуляторной отчетности. Поэтому значимость инцидента определяется заранее: какой бизнес-процесс зависит от данных, кто за него отвечает и когда задержка начинает создавать риск.

В Т‑Банке этот контекст формирует Data Incident Management. В DIM процессы получают согласованную критичность, которая задает приоритет, уровень эскалации и требования к устранению влияния. У объектов указаны ответственные дежурные и индикаторы доступности, а lineage показывает связи с другими объектами.

Сроки тоже задаются заранее. Soft deadline фиксирует ожидаемую готовность данных. Hard deadline показывает момент начала рисков. Во время инцидента DIM хранит статус и оповещения, а для критичных случаев фиксирует постанализ.

К моменту сигнала у платформы уже есть ответственный, область влияния и срок реакции. На масштабе сотен тысяч таблиц такой контекст позволяет восстанавливаться по единым правилам и сохранять управляемость при росте.

#reliability

DIM: что платформа знает о сбое заранее
Одна и та же задержка данных может быть допустимой для внутреннего отчета и критичной для операционного сервиса или регуляторной отчетности | Сетка — социальная сеть от hh.ru