Дал агенту написать тесты. Через 4 часа нашли баг.
Модуль расчёта скидок. Логика запутанная: 6 условий, вложенные проверки. Написать тесты руками лень. Дал агенту: «напиши тесты для DiscountService».
23 теста. Все зелёные. CI прошёл.
Через 4 часа QA нашла баг. Скидка для VIP при промокоде считалась неправильно. Откат, 2 часа простоя.
Открыл тесты. Сел.
Агент протестировал поведение существующего кода. А код был неправильным с самого начала. Все 23 теста прилежно проверяли что баг стабильно воспроизводится.
Я не дал ему спецификацию. Что должно происходить — не написал. Только что происходит сейчас.
Теперь правило: сначала пишу контракт поведения. 5 сценариев с ожидаемым результатом — до кода, до тестов, до агента. И первый прогон делаю на намеренно сломанной версии. Если тесты зелёные — контракт дырявый.
Агент пишет тесты быстро. Но тестирует то что есть, а не то что должно быть. Это разные задачи.
У вас было такое?