Data quality или качество данных
Существует такой знаменитый принцип - «Garbage in, garbage out», или «Мусор на входе - мусор на выходе». Я в банке занимаюсь построением моделей машинного обучения, а для моделей очень важны данные. Фактически, этот принцип для меня означает следующее: даже если я построю идеальную модель, то плохие данные на входе модели все испортят. И модель просто не будет работать!
Поэтому очень важно следить за качеством данных.
В больших компаниях данные проходят через разные слои, прежде чем попасть в конечную витрину для аналитики: RAW -> ODS -> DDS -> CDM. Обычно именно CDM-слой используется для аналитики и построения витрин с факторами для модели.
Очевидно, что один из вариантов мониторинга качества данных - это мониторинг потока данных после RAW слоя. А теперь представьте, что у вас тысячи источников и петабайты данных. И проверок на один источник несколько сотен. С одной стороны возникают проблемы по нагрузке расчета всех этих проверок, с другой стороны - проблема управления результатами этих проверок (представьте, что каждый день на почту вам сыпятся результаты сотен проверок по десяткам источников. Вы точно не будете это читать).
В общем, я наткнулся на интересную реализацию компонента Data quality от MTS: https://www.youtube.com/watch?v=nFNF4Esk9D8&ab_channel=ODSAIRu.
А посыл поста очень простой - DS должен не только модельки строить, а в первую очередь задумываться о данных, которые потребляет!