🧠 AI: за кулисами "разума" 🧠

Глава 8: Разработка LLM — дообучение, выравнивание и бюджеты 💰

После предобучения модель умеет продолжать текст. 📝 Но это не значит, что она умеет отвечать на вопросы. Если ей написать «Привет, как дела?», она может продолжить: «Привет, как дела? Я тоже хочу спросить…» — потому что в обучающих данных так начинались диалоги. Модель не знает, что она «собеседник» — она просто продолжает текст. 🤖

Этап 3: Supervised Fine-Tuning (SFT) — «обучение манерам». 🎓 Модель дообучают на датасете из «правильных» диалогов: вопрос — ответ. Тысячи–миллионы примеров, где человек задаёт вопрос, а ассистент отвечает коротко и по делу. Это как взять выпускника, который выучил всю теорию, и объяснить ему, что на собраниях нужно не лекцию читать, а отвечать на вопрос.

В 2026 году SFT-датасеты стали больше и качественнее. Появились синтетические данные: более мощная модель пишет вопросы и ответы, а потом на этом учится меньшая. Это называется дистилляция — и иногда меньшая модель наследует не только знания, но и привычки старшей: отвечать слишком длинно или добавлять ненужные извинения. «Яблочко от яблоньки», говорят инженеры. При SFT есть и риск: модель может частично забыть то, что знала после предобучения. Это называется catastrophic forgetting, и с ним борются, подмешивая в SFT-данные часть исходного корпуса.

Этап 4: RLHF / RLAIF — «воспитание характера». SFT учит модель отвечать. RLHF (Reinforcement Learning from Human Feedback) учит отвечать хорошо. Люди (или другая LLM) смотрят на ответы и ставят оценки. Модель учится давать больше «хороших» ответов и меньше «плохих».

В 2026 году RLHF эволюционировал:

DPO (Direct Preference Optimization) — часто проще и дешевле классического RLHF, но тоже требует аккуратной настройки. Не нужно обучать отдельную reward-модель, модель учится напрямую из пар «лучший/худший ответ». Это как выбор между двумя вариантами обеда: не нужно объяснять, почему один лучше — достаточно просто выбрать.

RLAIF (RL from AI Feedback) — вместо людей ответы оценивает другая LLM или та же модель с другим промптом. Дешевле, быстрее, но с риском: модель-оценщик может иметь свои «предпочтения», которые не совпадают с человеческими. Например, предпочитать длинные ответы коротким.

Этап 5: Evaluation и alignment — «госэкзамен». 📊 Evaluation измеряет качество: MMLU (знания), HumanEval (код), GSM8K (математика), SWE-Bench Verified (реальные GitHub issues) и AgentBench (агентные сценарии). Alignment — отдельная настройка безопасности: модель не должна давать вредных инструкций и генерировать токсичный контент. Иногда модель «пере-выполняет» инструктаж и начинает отказывать на вопрос «как сварить яйцо». Это называется over-correction, и борются с ним отдельным дообучением.

Отдельная головная боль — contamination: если тестовые примеры случайно попали в обучающие данные, модель может «знать» ответы, а бенчмарк перестаёт что-либо измерять. Поэтому лаборатории проверяют пересечения датасетов, используют скрытые тесты и регулярно обновляют наборы. Ещё один слой — red teaming: специально обученные люди ищут способы заставить модель нарушить правила. Это как пригласить хакеров, чтобы они взломали ваш офис раньше, чем это сделают настоящие.

Сколько это всё стоит? 💰 По разным оценкам, разработка флагманской модели с нуля в 2026 году: данные — 2–5 млн долларов, предобучение — 80–200 млн, SFT + RLHF — 5–15 млн, evaluation и safety — 2–5 млн. Итого: 90–230 млн долларов и 6–12 месяцев работы. Открытая модель уровня 70B — 5–20 млн, в десять раз дешевле. Для производных моделей цикл может занимать 2–3 месяца; обучение с нуля дольше.

Немного юмора. 😄 Разработка LLM — это как построить небоскрёб, где каждый кирпич стоит тысячу долларов, а архитектурный план меняется каждую неделю. 🏗️ Вы строите 200 этажей, и на 150-м понимаете, что фундамент был не тот. Перестраивать — поздно. Достраиваете как есть, потом говорят в пресс-релизе: «Это не баг, это архитектурное решение». А потом модель советует деплоить в пятницу. 🙃 И вы понимаете: где-то в обучающих данных, среди триллионов токенов, кто-то написал «да ладно, выкатим». И модель это выучила.

🧠 AI: за кулисами "разума" 🧠 | Сетка — социальная сеть от hh.ru