Первый ML-проект ч.4: Feature engineering

🧩Feature engineering - этап, на котором происходит преобразование старых и добавление новых признаков для ML-модели.

Данный этап включает в себя: - удаление лишних признаков в связи с их избыточностью и отсутствием пользы для модели - преобразование существующих признаков в подходящий для обучения модели вид - создание новых признаков на основе исходных, например, с помощью агрегации данных

🗑️Удаление лишних признаков необходимо для улучшения качества модели и борьбы с переобучением. В моем проекте такими признаками были столбцы с Source_IP и Destination_IP, т.к. они не влияли на характер атаки и признак Intrusion, т.к. он дублировал целевую переменную.

🛠️Преобразование существующих признаков нужно для приведения данных в подходящий для обучения модели формат. Например, стандартизация количественной переменной Payload_Size в проекте привела значения нагрузки в диапазон нормального распределения.

💡Создания новых признаков в моём проекте не было, т.к. я не хотел слишком усложнять себе работу для первого проекта и ничего не придумал.

🥴Могу сказать, что данный этап был для меня самым сложным. Во многом это связано с тем, что я не знал, как именно предобрабатывать и подготавливать данные. Обо всём я узнавал на ходу уже в процессе предобработки данных, а потом мне ещё пришлось переделывать всё, потому что я узнал об утечках данных. Но этот этап дал мне хороший опыт и улучшил понимание процессов предобработки данных.

Первый ML-проект ч.4: Feature engineering | Сетка — социальная сеть от hh.ru