Почему Feature Engineering — это мыть посуду?

Знакомо: все мечтают строить нейросети, играть с ChatGPT и хвастаться accuracy в 99%. А Feature Engineering? Ну, это как мыть посуду после праздничного ужина — все понимают, что надо, но делать это не рвутся. А зря. Потому что без нормальных фич даже самая крутая модель превращается в гадалку на кофейной гуще.

Вот история, которая случается слишком часто: компания берет дата-сайентиста, закупает GPU, тренирует модель на миллионах параметров… А потом оказывается, что она предсказывает отток клиентов хуже, чем менеджер по продажам с утра пораньше. Почему? Потому что фичи были как попало.

Возьмем реальный пример: одна команда пыталась предсказать цены на жильё. Сначала они запихнули в модель кучу данных — площадь, этаж, район. Accuracy — 70%. Потом кто-то догадался добавить фичу «расстояние до метро» (рассчитанное через API карт). И вуаля — 85%! Никакой магии, просто здравый смысл и понимание, что людям лень ходить пешком.

Но нет, все равно все хотят в ML. Почему?

Потому что нейросети — это круто, а Feature Engineering — «нууу, скукота». Согласитесь, звучит менее сексуально: «Я целый день создавал бинарные фичи из категориальных переменных» vs «Я обучил трансформер на 10 млрд параметров». Но вот в чем прикол: если ваши данные — это мусор, то хоть GPT-10 запускайте — на выходе будет мусор с надписью «AI».

Однажды компания потратила полгода на модель для прогноза спроса. А потом выяснилось, что в данных были отрицательные значения продаж (типа «-5 айфонов купили»). Модель старалась, училась… И выдавала прогнозы, от которых плакали логисты. А всё потому, что никто не проверил фичи на адекватность.

Feature Engineering — это не про код, это про понимание жизни. Чтобы делать крутые фичи, нужно:

  • Знать, как работает бизнес (например, что «длительность последнего звонка в поддержку» лучше предсказывает отток, чем возраст клиента).
  • Уметь задавать дурацкие вопросы вроде: «А почему у нас в данных есть люди с 25 часами в сутках?».
  • Иметь терпение, чтобы 80% времени ковыряться в данных, а не в нейросетях.

Да, это не так эффектно, как тренировка GAN. Зато, когда вы добавляете фичу, которая даёт +30% к точности, вы чувствуете себя волшебником. Проверено: однажды простая фича «сезонность спроса» сэкономила компании полмиллиона долларов. И никаких трансформеров!

Что делать, если вы всё ещё хотите в ML? Совет от того, кто наступал на эти грабли: 1. Начните с вопроса «Какие данные у нас вообще есть?» (спойлер: они будут кривыми). 2. Поговорите с теми, кто работает в бизнесе. Маркетолог может случайно сказать что-то вроде: «Да наши клиенты всегда уходят после второго штрафа» — и это станет вашей лучшей фичей. 3. Попробуйте сначала линейную регрессию. Если она не работает, возможно, проблема не в модели, а в фичах.

Фичевый инжиниринг — это как учиться играть на гитаре: сначала бьешься над аккордами, зато потом можешь сыграть что угодно. А если пропустить это… Ну, вы видели кавер-группы, где гитарист только имитирует игру? Вот так же и с ML без Feature Engineering.

Так что да, Feature Engineering — это не гламурно. Зато это работает. А вы как думаете — стоит ли тратить время на фичи, или пусть нейросети сами разбираются? 👇

Почему Feature Engineering — это мыть посуду? | Сетка — социальная сеть от hh.ru Почему Feature Engineering — это мыть посуду? | Сетка — социальная сеть от hh.ru