Полгода назад у нас был один автотест. Сейчас их 878

Не одна папка с тестами — один тест. Сейчас их 878, и заметную часть пишут не люди, а команда ИИ-агентов, которую я собрал в X5 Tech.

Про «LLM пишет автотесты» написано уже много: взяли модель, дали промпт, получили черновик, инженер поправил. Работает — и упирается в потолок примерно через неделю. Промпт живёт в голове автора, качество плавает от запуска к запуску, и никто не может ответить на вопрос: а этот новый супер-промпт вообще лучше, чем без него?

Мы собрали не агента, а команду с контрактами. Восемь ролей в тестировании, у каждой своя зона ответственности, свои процедуры и свой журнал ошибок, который она обязана прочитать перед работой.

Но самое интересное оказалось не в этом.

Главная проблема любого набора промптов — они попадают в систему на доверии. Кто-то написал, показалось хорошим, закоммитили. Через полгода у вас сто промптов, из которых работают тридцать, а какие именно — не знает никто.

Поэтому мы сделали для инструментов обычный TDD-гейт (он на картинке). Сначала агент решает задачу БЕЗ инструмента — это базовая линия. Потом тот же агент с инструментом. Если разницы нет — инструмент удаляется. Не «полежит, вдруг пригодится», а именно удаляется, как мёртвый код.

Отдельное правило, которым я горжусь больше всего: вердикт «вариант Б лучше» невалиден, если не доказан паритет по корректности. Проще говоря — дешевле и быстрее не считается победой, если результат хуже. Это тот самый разговор, который QA ведёт с бизнесом последние двадцать лет. Теперь он зашит в линтер и падает в CI.

Что получилось в цифрах: — написание автотеста было 1–2 дня с учётом ожидания разработки, стало 43–45 тестов за 30 минут вместе с отладкой; — тестовая модель выросла втрое, длительность регресса осталась прежней; — разработчиков полностью убрали из подготовки тестовой инфраструктуры.

Главный вывод: когда код начинают писать агенты, узким местом становится не скорость производства, а доверие к результату. А выстраивать доверие к результату — это ровно то, чем профессионально занимается тестирование.

Статья вышла: https://habr.com/ru/sandbox/298772/ — там подробно про устройство харнесса, гейт RED/GREEN и журнал граблей, который агенты обязаны читать перед работой. Буду рад вопросам в комментариях.

Полгода назад у нас был один автотест. Сейчас их 878 | Сетка — социальная сеть от hh.ru