Основы качества данных, глава третья, часть 3/*.

Про очистку данных.

📎 Одна из самых больших сложностей на пути к высокому качеству данных - их очистка, удаление неточных данных. Основные способы:

📎 Удаление выбросов. Рекомендуется делать это как можно раньше, если только нет цели найти как раз выбросы.

📎 Оценка особенностей набора данных. Все ли таблицы в схеме нужны для исследования? Все ли поля в таблице? Есть ли однозначная документация на всё это?

📎 Нормализация. Про это много написано, полезная штука.

📎 Реконструкция данных. Например, если данных почему-то нет в небольшом количестве. Пишут, что это неизбежно. Можно использовать интер-/экстраполяцию, категоризацию данных.

📎 Преобразование часового пояса. Мега важная штука! Представьте, что вы летите в новогоднюю ночь с востока на запад и каждый час отмечаете новый год. Какой считать "настоящим"?) должен быть какой-то стандарт, чаще всего это UTC или приведение к нему, иначе можно никогда не узнать, когда произошли события относительно друг друга.

📎 Приведение типов. Данные типизированы, но форматы могут отличаться. Необходимо "причесать" весь имеющийся зоопарк типов и привести к удобным для последующей работы типам.

#качестводанных #dataquality #dqf