Плэйбой, миллиардер, филантроп А нет, стоп, это не про меня
Дата саентист, перфекционист, криворучка Во, теперь про меня
У вас бывало ощущение, что вы в жизни перформите как очень плохо затюненая модель? Все пытаетесь, пытаетесь, пробуете разные подходы, но результат один — очень плохо? Этакий градиентный спуск, катает вас по локальным минимумам, но никак не сходится?
Вот у меня так всегда. На кухне. Мы не совместимы, но я продолжаю упорно сражаться.
История как всегда начинается с оптимизма (и завышенных ожиданий, ну а что, 162 раза до этого не вышло, почему на 163-ий не должно получиться?)
Решила я, значит, сделать бургер как в Маке (грешна, обожаю, плюс ещё и не толстею). Главное в бургере — котлета. Купила говядину (дорого, почти как датасет для обучения GPT), специальную мясорубку (мою личную GPU для фарша) и даже кулинарный термометр (метрики, ага).
Поставила все на стол с мыслями, что с таким набором из идеальных данных, инфры и инструментария я точно все смогу (ну а что, осталось «просто приготовить»)
А дальше… дальше backpropagation разочарования. В контексте нейросетей backpropagation (механизм обратного распространения ошибки) — это то, что позволяет нейросети «понимать» свои ошибки и корректировать веса связей между нейронами. Мои нейроны, всегда отвергавшие кухню, вздохнули и позволили рукам творить.
Попытка раз. Первый batch данных. Прокрутила фарш как по учебнику: правильная консистенция, масло для сочности. Сформировала идеальную круглую котлету. Жарим. Сухая. Как душа HR. Минимальной съедобности котлета. Ну ничего! Это первая попытка, и просто локальный минимум (на языке машинного обучения это когда алгоритм находит не самое оптимальное решение).
Попытка два. Backpropagation в реальной жизни. Корректирую параметры. Добавила больше масла, котлетку слепила поменьше. Итог? Котлета получилась как желе. Мутная и вязкая, как классическое ТЗ от бизнеса. Похоже, моя «оптимизация» только ухудшила ситуацию, и я переборщила с «побольше» масла и «поменьше» мяса. Прям как learning rate — параметр, определяющий, насколько сильно мы корректируем веса сети.
Три. Momentum в действии. В машинном обучении momentum работает как память о предыдущих шагах: — Учитывает предыдущие изменения параметров — Помогает избежать резких скачков — Сглаживает колебания при обучении —Ускоряет движение к оптимальному решению Третий подход я решила делать с учётом предыдущих ошибок. Немного уменьшила количество масла, увеличила радиус котлеты, притушила огонь. И… снова провал. Котлета развалилась на сковороде, как премия айтишников в 2025 году.
Нейроны в голове праздновали победу несходимости несовместимости меня и кухни. Муж за спиной аппроксимировал реальную функцию затрат: цену мяса к количеству попыток.
А я оглядывала разгромленную кухню и прикидывала, с какими ещё ключевыми параметрами мне сегодня удалось поработать:
Batch size — количество котлет за раз (у меня — одна, но с потенциалом на серию)
Epochs — количество попыток (три подхода, могло быть больше, но мы проголодались)
Loss function — моя субъективная оценка качества котлеты (от «в целом можно накормить бродячих собак» до «Гордон Рамзи сжег бы тебя вместе с этой котлетой»)
В итоге, упаковав все свои «обученные» котлеты в докер-контейнер под названием мусорное ведро, мы отправились в Мак.
Вернее во «вкусно и точка». За грибным БигСпешл. Кстати, вот классный пример, как ребята взяли предобученную модель в виде рецепта Мака и дообучили ее сезонными российскими ингредиентами.
А у вас были примеры с неудачными обучениями? Пишите, вдруг мне тоже захочется попробовать!