Первый ML-проект ч.4: Feature engineering
🧩Feature engineering - этап, на котором происходит преобразование старых и добавление новых признаков для ML-модели.
Данный этап включает в себя: - удаление лишних признаков в связи с их избыточностью и отсутствием пользы для модели - преобразование существующих признаков в подходящий для обучения модели вид - создание новых признаков на основе исходных, например, с помощью агрегации данных
🗑️Удаление лишних признаков необходимо для улучшения качества модели и борьбы с переобучением. В моем проекте такими признаками были столбцы с Source_IP и Destination_IP, т.к. они не влияли на характер атаки и признак Intrusion, т.к. он дублировал целевую переменную.
🛠️Преобразование существующих признаков нужно для приведения данных в подходящий для обучения модели формат. Например, стандартизация количественной переменной Payload_Size в проекте привела значения нагрузки в диапазон нормального распределения.
💡Создания новых признаков в моём проекте не было, т.к. я не хотел слишком усложнять себе работу для первого проекта и ничего не придумал.
🥴Могу сказать, что данный этап был для меня самым сложным. Во многом это связано с тем, что я не знал, как именно предобрабатывать и подготавливать данные. Обо всём я узнавал на ходу уже в процессе предобработки данных, а потом мне ещё пришлось переделывать всё, потому что я узнал об утечках данных. Но этот этап дал мне хороший опыт и улучшил понимание процессов предобработки данных.
· 21.03
Добрый день! Как вы отбираете из генерированных признаков наиболее значимые?
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён
· 21.03
Честно говоря, это хороший вопрос) Отбор признаков я проводил на этапе EDA: выводил столбчатые диаграммы для качественных признаков, смотрел на распределение количественных признаков, смотрел на взаимосвязи признаков. На этапе Feature Engineering уже преобразовывал количественные и качественные приднаки. После этого проверки значимости признаков не производилось. Мне стоит почитать об этом, спасибо!)
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён
· 21.03
Спасибо за ответ! Я работаю с большими данными, используем модели для отбора признаков, например, рандомный лес. Думала, вдруг что интересного нового узнаю. Статья у вас хорошая
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён