Мы используем omp как роутер: он решает, какую модель подключить, когда позвать отдельного агента и как не гонять одну и ту же историю по кругу.

Поэтому меня зацепила статья NVIDIA, MIT и NTU про SoL-Pi. Они оптимизировали не саму языковую модель, а harness вокруг кодинг-агента.

Другой AI-исследователь предложил 152 изменения. В финал прошли только четыре:

  • объединять правку файла и запуск тестов в один вызов;
  • не таскать большие логи целиком после каждого шага;
  • сжимать диагностические логи дешёвой моделью, проверяя цитаты ошибок по оригиналу;
  • запускать compaction только тогда, когда экономия перекрывает цену перезаписи prompt cache.

На 51 задаче EdgeBench токеновый трафик упал на 44,7-49%, а счёт за API - примерно на треть. На GPT-5.6 Sol: $1339 у базового Pi против $894 у полного SoL-Pi.

Но есть цена: средний балл снизился с 44,8 до 42,0.

Самый интересный результат дал один механизм, ObservationPack: $1271 и 47,2 балла. То есть экономия есть, а измеренного падения качества нет. Правда, прогон был один, поэтому разницу в несколько баллов я бы пока не называл доказанным улучшением.

Для меня вывод простой: иногда выгоднее оптимизировать не модель, а всё, что происходит вокруг неё. Мы в omp как раз работаем с этим слоем: маршрутизацией, контекстом, делегированием и стоимостью каждого следующего шага.

Статья: https://arxiv.org/abs/2609.20519 Код: https://github.com/NVlabs/SoL-Pi