мониторинг

чтобы быть уверенным, чтобы данные правильно поступают в хранилище, за инфраструктурой надо следить. самый простой способ отслеживать статус инфры это каждые секунд 10-20 спрашивать у сервисов доступны ли они и выводить график этих опросов. следить за графиками полезно, но иногда, если каждая секунда простоя стоит много, лучше сделать алертинг.

алертинг это улучшенный способ следить за инфраструктурой: если какой-то сервис падает, сервис супервизор сообщит вам об этом по удобному вам каналу. очень важно, чтобы супервизор был на отличном от сервиса сервере. потому что если они будут на одном, супервизор упадет вместе с сервисом и не предупредит об этом.

также по мере роста платформы данных очень важно мониторить качество данных. в самом начале это могут самые простые показатели, например актуальность, но в дальнейшем надо обязательно отслеживать остальные 4 показателя: полнота, точность и согласованность. этот список можно расширить, но основные звучат так.