Масштаб претрейна LLM
В эру развития больших языковых моделей я часто слышу, как люди говорят: "сделал свою llm для медицины" или "собрал своего агента". Но на самом деле, конечно, никто не обучал свою LLM. Да и большая вероятность, что агента тоже нет (но об этом не здесь).
Сама llm обучается в несколько этапов. Сконцентрируемся на самом первом и самом дорогом - pretrain. В данном случае модель учится предсказывать каждый следующий токен по всем предыдущим.
Для такой задачи размеченные данные не нужны. Просто подаем в модель очень много текстовой информации. Посмотрим на три популярных технических отчета (T - это триллионы):
DeepSeek-V3 — 14.8T токенов Kimi K2 — 15.5T токенов Qwen3 — 36T токенов
Например, в книге "Война и мир" примерно 0.75M токенов, а во всей английской википедии 7B токенов. То есть в данных для обучения Qwen3 48 миллионов книг "Война и мир" и примерно 5100 Википедий.
Нам повезло, отчет DeepSeek-V3 довольно подробный, в нем приведена оценка железа. Учили модель менее 2 месяцев на 2048 H800. В деньгах - примерно 5,6 миллионов долларов — но это стоимость лишь одного успешного прогона, без учёта исследований, неудачных запусков и самого кластера.
Большинство компаний не учат модели с нуля, а файнтюнят. Об этом в следующих постах.