Агент тонет в требованиях

Все читают бенчмарк SWE-RPG как "агенты плохо пишут код". Это правда. Не сказано другое: узкое место - не генерация кода, а восстановление неявных требований.

Цифры: 163 задачи, 31 репозиторий, 3 агента (Claude Code, Codex, OpenCode), 6 бэкендов. Средний resolved rate - 31,5%. Но диагностика по промежуточным ground truth показывает: 24,5-46,0% провалов - это не код, а то, что агент не восстановил неявное требование.

Следствие для аналитика: ваша работа не исчезает, она смещается. Агенту нужен не промпт "сделай фичу", а явные и неявные требования, собранные до запуска. Кто их готовит - тот и управляет результатом.

Источник: https://arxiv.org/abs/2608.09072 Фото: Yen Vu / Unsplash

#AI #аналитика #требования

Агент тонет в требованиях | Сетка — социальная сеть от hh.ru