Почему грязные данные опаснее, чем кажется
Многие воспринимают грязные данные (dirty data) слишком упрощенно. Как опечатки, дубли или проблемы в Excel.
Но грязные данные появляются почти в любой компании, где данные собираются из разных систем. В какой-то момент одна и та же информация начинает существовать в нескольких версиях.
⚠️ Но самая опасная проблема — смысловые искажения
Например, компания анализирует среднее время доставки и видит стабильные 3 дня. Но в одном отчете смешаны доставка по Москве и поставки в удаленные регионы. В итоге бизнес получает «среднюю температуру», которая скрывает реальные проблемы в логистике.
Ручной очистки данных для этого уже недостаточно. На больших объемах данные обновляются быстрее, чем их успевают проверять.
Поэтому компании выстраивают автоматическую систему контроля качества данных: ➖ строят единые data pipelines (конвейеры данных) ➖ автоматически проверяют данные на дубли и аномалии ➖ внедряют Data Profiling (профилирование данных) и валидацию ➖ связывают данные между системами через Entity Resolution (разрешение сущностей) ➖ вводят единые правила работы с мастер-данными
Аналитика не может существовать отдельно от качества данных 📊
Поэтому вопрос качества данных сегодня — это вопрос того, может ли бизнес вообще доверять собственной аналитике