Посмотрел доклад с deep tech night от Ивана Сапожкова, руководителя группы базовой ML-инфраструктуры Яндекса, про инфраструктуру RL-обучения.
Так вот, мы сейчас все обсуждаем агентов на уровне моделей, промптов, инструментов, памяти и харнесов. В общем, на уровне того, что видит разработчик и пользователь.
А под этим уже приходится переделывать и сам процесс обучения моделей.
Когда модель обучают на агентных задачах через RL, вокруг неё приходится строить целую распределенную систему. Одна часть в режиме инференса генерирует траектории для обучения — модель взаимодействует со внешними средами, выполняет код, ищет информацию, вызывает инструменты. Полученные данные затем через очереди и буферы попадают в обучающую часть, где уже обновляются веса модели.
И всё это надо синхронизировать так, чтобы одни процессы не стояли и не ждали другие.
На бумаге красота. Генерация ровно успевает поставлять данные, обучение успевает их переваривать..
Только живёт такой идеальный баланс недолго. Траектории сильно отличаются по длине: одна задача заканчивается быстро, другая уходит в длинное рассуждение, делает несколько вызовов инструментов или долго взаимодействует со средой. В итоге где-то простаивают вычислительные мощности, где-то копятся данные, а несколько длинных генераций могут задерживать весь следующий шаг обучения.
Поэтому в Яндексе пришли к гибридной схеме: генерацию и обучение балансируют по времени, а незаконченные траектории сохраняют и продолжают на следующем шаге. Система подстраивается под реальную нагрузку и не пытается один раз идеально поделить железо.
Я всё к тому, что агентный бум уже перестраивает нижние этажи ML-стека.
Пользователь видит чат с агентом. Мы с вами видим инструменты и харнесы. А ещё ниже команды пересобирают RL-инфраструктуру, потому что обучение моделей на таких задачах создаёт совсем другой профиль нагрузки — длинные и непредсказуемые генерации, внешние среды, tool calls и дорогой инференс прямо внутри training loop.
Мы сейчас, конечно, увлеченно крафтим свои харнесы. Но дальше гонка пойдёт ещё и за инфраструктуру, которая умеет эффективно обучать такие системы и не сжигать вычисления на ожидании.
Короче, снаружи агентная революция выглядит как удобный интерфейс. В машинном отделении у неё – инференс, очереди, буферы, длинные хвосты и очень дорогие GPU.
За этим слоем я теперь тоже буду внимательно следить.