Почему Feature Engineering — это мыть посуду?
Знакомо: все мечтают строить нейросети, играть с ChatGPT и хвастаться accuracy в 99%. А Feature Engineering? Ну, это как мыть посуду после праздничного ужина — все понимают, что надо, но делать это не рвутся. А зря. Потому что без нормальных фич даже самая крутая модель превращается в гадалку на кофейной гуще.
Вот история, которая случается слишком часто: компания берет дата-сайентиста, закупает GPU, тренирует модель на миллионах параметров… А потом оказывается, что она предсказывает отток клиентов хуже, чем менеджер по продажам с утра пораньше. Почему? Потому что фичи были как попало.
Возьмем реальный пример: одна команда пыталась предсказать цены на жильё. Сначала они запихнули в модель кучу данных — площадь, этаж, район. Accuracy — 70%. Потом кто-то догадался добавить фичу «расстояние до метро» (рассчитанное через API карт). И вуаля — 85%! Никакой магии, просто здравый смысл и понимание, что людям лень ходить пешком.
Но нет, все равно все хотят в ML. Почему?
Потому что нейросети — это круто, а Feature Engineering — «нууу, скукота». Согласитесь, звучит менее сексуально: «Я целый день создавал бинарные фичи из категориальных переменных» vs «Я обучил трансформер на 10 млрд параметров». Но вот в чем прикол: если ваши данные — это мусор, то хоть GPT-10 запускайте — на выходе будет мусор с надписью «AI».
Однажды компания потратила полгода на модель для прогноза спроса. А потом выяснилось, что в данных были отрицательные значения продаж (типа «-5 айфонов купили»). Модель старалась, училась… И выдавала прогнозы, от которых плакали логисты. А всё потому, что никто не проверил фичи на адекватность.
Feature Engineering — это не про код, это про понимание жизни. Чтобы делать крутые фичи, нужно:
- Знать, как работает бизнес (например, что «длительность последнего звонка в поддержку» лучше предсказывает отток, чем возраст клиента).
- Уметь задавать дурацкие вопросы вроде: «А почему у нас в данных есть люди с 25 часами в сутках?».
- Иметь терпение, чтобы 80% времени ковыряться в данных, а не в нейросетях.
Да, это не так эффектно, как тренировка GAN. Зато, когда вы добавляете фичу, которая даёт +30% к точности, вы чувствуете себя волшебником. Проверено: однажды простая фича «сезонность спроса» сэкономила компании полмиллиона долларов. И никаких трансформеров!
Что делать, если вы всё ещё хотите в ML? Совет от того, кто наступал на эти грабли: 1. Начните с вопроса «Какие данные у нас вообще есть?» (спойлер: они будут кривыми). 2. Поговорите с теми, кто работает в бизнесе. Маркетолог может случайно сказать что-то вроде: «Да наши клиенты всегда уходят после второго штрафа» — и это станет вашей лучшей фичей. 3. Попробуйте сначала линейную регрессию. Если она не работает, возможно, проблема не в модели, а в фичах.
Фичевый инжиниринг — это как учиться играть на гитаре: сначала бьешься над аккордами, зато потом можешь сыграть что угодно. А если пропустить это… Ну, вы видели кавер-группы, где гитарист только имитирует игру? Вот так же и с ML без Feature Engineering.
Так что да, Feature Engineering — это не гламурно. Зато это работает. А вы как думаете — стоит ли тратить время на фичи, или пусть нейросети сами разбираются? 👇
· 09.06.2025
Пост просто огонь
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён