AI-агент ошибается? Да.
Если бы разработчики писали код без ошибок, нас бы не было. Так и с ИИ: его надо обучить, дать инструменты, правила, скиллы.
Но дальше начинается то, что мы умеем лучше всех. Мы всегда работаем с исполнителем, который ошибается. Никто не говорит «разработчик написал баг, значит разработка не работает». Мы просто строим процесс, где ошибка ловится до прода.
С агентом так же. У меня после сборки чеклиста обязательный гейт: второй агент на другой модели ревьюит его по фиксированному промпту. Сверяет с критериями приёмки и диффом, возвращает пропущенное и выдуманное. Работает по той же причине, что и код-ревью: у выдумки нет источника, подтвердить нечего, пункт отваливается.
Решение «баг это или бизнес-логика» не отдаю никому. Агент приносит факты, вывод делаю я.
«ИИ ошибается» это не аргумент против агентов. Это описание любого исполнителя. Вопрос в том, есть ли процесс, который ошибку ловит.
Мы вообще-то именно этим и занимаемся.