Посмотрел доклад с deep tech night от Ивана Сапожкова, руководителя группы базовой ML-инфраструктуры Яндекса, про инфраструктуру RL-обучения.

Так вот, мы сейчас все обсуждаем агентов на уровне моделей, промптов, инструментов, памяти и харнесов. В общем, на уровне того, что видит разработчик и пользователь.

А под этим уже приходится переделывать и сам процесс обучения моделей.

Когда модель обучают на агентных задачах через RL, вокруг неё приходится строить целую распределенную систему. Одна часть в режиме инференса генерирует траектории для обучения — модель взаимодействует со внешними средами, выполняет код, ищет информацию, вызывает инструменты. Полученные данные затем через очереди и буферы попадают в обучающую часть, где уже обновляются веса модели.

И всё это надо синхронизировать так, чтобы одни процессы не стояли и не ждали другие.

На бумаге красота. Генерация ровно успевает поставлять данные, обучение успевает их переваривать..

Только живёт такой идеальный баланс недолго. Траектории сильно отличаются по длине: одна задача заканчивается быстро, другая уходит в длинное рассуждение, делает несколько вызовов инструментов или долго взаимодействует со средой. В итоге где-то простаивают вычислительные мощности, где-то копятся данные, а несколько длинных генераций могут задерживать весь следующий шаг обучения.

Поэтому в Яндексе пришли к гибридной схеме: генерацию и обучение балансируют по времени, а незаконченные траектории сохраняют и продолжают на следующем шаге. Система подстраивается под реальную нагрузку и не пытается один раз идеально поделить железо.

Я всё к тому, что агентный бум уже перестраивает нижние этажи ML-стека.

Пользователь видит чат с агентом. Мы с вами видим инструменты и харнесы. А ещё ниже команды пересобирают RL-инфраструктуру, потому что обучение моделей на таких задачах создаёт совсем другой профиль нагрузки — длинные и непредсказуемые генерации, внешние среды, tool calls и дорогой инференс прямо внутри training loop.

Мы сейчас, конечно, увлеченно крафтим свои харнесы. Но дальше гонка пойдёт ещё и за инфраструктуру, которая умеет эффективно обучать такие системы и не сжигать вычисления на ожидании.

Короче, снаружи агентная революция выглядит как удобный интерфейс. В машинном отделении у неё – инференс, очереди, буферы, длинные хвосты и очень дорогие GPU.

За этим слоем я теперь тоже буду внимательно следить.

Посмотрел доклад с deep tech night от Ивана Сапожкова, руководителя группы базовой ML-инфраструктуры Яндекса, про инфраструктуру RL-обучения | Сетка — социальная сеть от hh.ru