🧠 AI: за кулисами "разума" 🧠
Глава 7: Разработка LLM — данные и предобучение 🏭
Архитектура — это чертёж. 📐 Но чертёж не ездит. 🚫 Чтобы модель заработала, её нужно построить. И вот тут начинается самое весёлое: разработка LLM — это не «написал код, запустил, работает». Это многоэтапный конвейер, где каждый этап стоит миллионы, занимает месяцы и может пойти не так в любой момент. Как деплой в пятницу, только растянутый на полгода и с бюджетом небольшого государства. 💸 Всего этапов пять: данные, предобучение, fine-tuning, выравнивание и оценка. Сегодня — первые два. 👇
Этап 1: Сбор и подготовка данных — «закупка продуктов». 🛒
Всё начинается с данных. Модель учится на текстах, и качество этих текстов определяет всё. В 2026 году флагманские модели обучаются на 15–30 триллионах токенов. Для масштаба: англоязычная Википедия — это примерно 4 миллиарда токенов. То есть модель читает её от 4000 до 7000 раз. 📚 Представьте человека, который прочитал Википедию 4000 раз. Теперь представьте, что он ещё не сошёл с ума. 😵 Модель — не сошла. Наверное, потому что у неё нет эмоций. 🤖
Данные собирают из открытых источников: книги, статьи, код, веб-страницы. Но собрать — полдела. Их нужно очистить: убрать дубликаты, спам, низкокачественный контент, персональные данные, токсичные фрагменты. Это называется data curation, и это одна из самых недооценённых частей разработки LLM. Все говорят «модель умная», но никто не говорит «дата-инженер, который очистил 30 триллионов токенов от мусора — гений». 🧹
Качество данных важнее их количества: модель, обученная на меньшем, но более чистом датасете, часто обходит ту, что видела больше грязного текста. Поэтому крупные лаборатории тратят на data curation до 30% бюджета обучения. 💰
В 2026 году появились автоматические конвейеры для data curation: небольшие модели или классификаторы фильтруют данные для больших моделей. Получается, маленькая LLM решает, чему учить большую LLM. Это как если бы стажёр составлял учебный план для профессора. 🎓 Звучит странно, но работает — потому что фильтровать 30 триллионов токенов вручную не возьмётся ни один человек. 🤯
За этими этапами стоит огромная команда: исследователи, инженеры, дата-сайентисты. В 2026 году над флагманской моделью работают сотни человек, а обучение одной версии может стоить от 100 до 500 миллионов долларов. 👥
Этап 2: Предобучение (Pre-training) — «запекание в печи». 🔥
Очищенные данные загружаются в модель, и начинается предобучение. Модель читает текст и пытается предсказать следующий токен. Ошибается — корректирует параметры через обратное распространение ошибки. Ошибается снова — корректирует снова. И так — триллионы раз. 🔁
Этот этап — самый дорогой и долгий. В 2026 году предобучение флагманской модели (общее число параметров порядка триллиона, но активных — в разы меньше) требует 30–50 тысяч GPU (обычно H100 или B200) на протяжении 2–4 месяцев. Бюджет на электричество — миллионы долларов. ⚡ На этих деньгах можно было бы питать небольшой город. 🏙️ Вместо этого мы питаем модель, которая потом будет советовать деплоить в пятницу. 🙃
Loss-функция — это метрика ошибки. Чем ниже — тем лучше. 📉 График loss во время предобучения выглядит как лестница: падает, плато, падает, плато. Когда loss перестаёт падать — модель «выучила» всё, что могла. Когда loss начинает расти — что-то пошло не так, и кто-то бежит перезапускать кластер. 🏃 Самый страшный момент в жизни ML-инженера — увидеть растущий loss на 40-й день обучения. Это как увидеть дым из капота на трассе, только капот стоит 200 миллионов долларов. 💥 И если чекпоинты не сохранены — обучение придётся начинать заново.
Иногда loss падает слишком быстро — это тоже тревожный сигнал. ⚠️ Значит, модель переобучается или данные слишком простые. Приходится менять гиперпараметры или пересматривать датасет.
В 2026 году предобучение часто разбивают на стадии: сначала модель учится на «общем» тексте, потом — на качественных curated-данных. Это многостадийное обучение работает примерно как школьная программа: сначала букварь, потом учебники, потом — научная библиотека. 📖