Первый ML-проект ч.3: EDA
🔎Этап разведочного анализа данных (Exploratory Data Analysis) предполагает изучение статистических показателей, поиск выбросов, построение графиков для понимания характеристик данных и нахождения закономерностей
🎯Цель EDA - понимание структуры наших данных, нахождение аномалий в них, поиск взаимосвязанных признаков, оценка влияния признаков на целевую переменную. Понимание всего этого позволит лучше обработать данные и выбрать подходящие признаки для нашей модели.
📊На данном этапе мне очень помогло знание статистики, спасибо курсам «Основы статистики» на stepik’е! Что из статистики важно понимать для разведочного анализа данных: - различные графики: гистограмма частот, столбчатая диаграмма, ящик с усами (box plot), диаграмма рассеяния, тепловая карта и другие - Меры центральной тенденции: среднее, мода, медиана - Меры вариации: дисперсия, стандартное отклонение - Зависимости: ковариация, корреляция
🕐По времени данный этап занял больше всего: - Во-первых, нужно было тщательно подойти к анализу данных и изучению их структуры, а это само по себе занимает много времени. - Во-вторых, часто приходилось заглядывать в документацию matplotlib и seaborn для поиска нужных функций и параметров для построения графиков. Ещё чаще приходилось открывать документацию pandas для работы с датафреймами и отбором данных.
👨💻Благодаря этому этапу я выделил все нужные признаки и понял от каких признаков лучше избавиться.