Мы используем omp как роутер: он решает, какую модель подключить, когда позвать отдельного агента и как не гонять одну и ту же историю по кругу.
Поэтому меня зацепила статья NVIDIA, MIT и NTU про SoL-Pi. Они оптимизировали не саму языковую модель, а harness вокруг кодинг-агента.
Другой AI-исследователь предложил 152 изменения. В финал прошли только четыре:
- объединять правку файла и запуск тестов в один вызов;
- не таскать большие логи целиком после каждого шага;
- сжимать диагностические логи дешёвой моделью, проверяя цитаты ошибок по оригиналу;
- запускать compaction только тогда, когда экономия перекрывает цену перезаписи prompt cache.
На 51 задаче EdgeBench токеновый трафик упал на 44,7-49%, а счёт за API - примерно на треть. На GPT-5.6 Sol: $1339 у базового Pi против $894 у полного SoL-Pi.
Но есть цена: средний балл снизился с 44,8 до 42,0.
Самый интересный результат дал один механизм, ObservationPack: $1271 и 47,2 балла. То есть экономия есть, а измеренного падения качества нет. Правда, прогон был один, поэтому разницу в несколько баллов я бы пока не называл доказанным улучшением.
Для меня вывод простой: иногда выгоднее оптимизировать не модель, а всё, что происходит вокруг неё. Мы в omp как раз работаем с этим слоем: маршрутизацией, контекстом, делегированием и стоимостью каждого следующего шага.
Статья: https://arxiv.org/abs/2609.20519 Код: https://github.com/NVlabs/SoL-Pi