Полгода назад у нас был один автотест. Сейчас их 878
Не одна папка с тестами — один тест. Сейчас их 878, и заметную часть пишут не люди, а команда ИИ-агентов, которую я собрал в X5 Tech.
Про «LLM пишет автотесты» написано уже много: взяли модель, дали промпт, получили черновик, инженер поправил. Работает — и упирается в потолок примерно через неделю. Промпт живёт в голове автора, качество плавает от запуска к запуску, и никто не может ответить на вопрос: а этот новый супер-промпт вообще лучше, чем без него?
Мы собрали не агента, а команду с контрактами. Восемь ролей в тестировании, у каждой своя зона ответственности, свои процедуры и свой журнал ошибок, который она обязана прочитать перед работой.
Но самое интересное оказалось не в этом.
Главная проблема любого набора промптов — они попадают в систему на доверии. Кто-то написал, показалось хорошим, закоммитили. Через полгода у вас сто промптов, из которых работают тридцать, а какие именно — не знает никто.
Поэтому мы сделали для инструментов обычный TDD-гейт (он на картинке). Сначала агент решает задачу БЕЗ инструмента — это базовая линия. Потом тот же агент с инструментом. Если разницы нет — инструмент удаляется. Не «полежит, вдруг пригодится», а именно удаляется, как мёртвый код.
Отдельное правило, которым я горжусь больше всего: вердикт «вариант Б лучше» невалиден, если не доказан паритет по корректности. Проще говоря — дешевле и быстрее не считается победой, если результат хуже. Это тот самый разговор, который QA ведёт с бизнесом последние двадцать лет. Теперь он зашит в линтер и падает в CI.
Что получилось в цифрах: — написание автотеста было 1–2 дня с учётом ожидания разработки, стало 43–45 тестов за 30 минут вместе с отладкой; — тестовая модель выросла втрое, длительность регресса осталась прежней; — разработчиков полностью убрали из подготовки тестовой инфраструктуры.
Главный вывод: когда код начинают писать агенты, узким местом становится не скорость производства, а доверие к результату. А выстраивать доверие к результату — это ровно то, чем профессионально занимается тестирование.
Статья вышла: https://habr.com/ru/sandbox/298772/ — там подробно про устройство харнесса, гейт RED/GREEN и журнал граблей, который агенты обязаны читать перед работой. Буду рад вопросам в комментариях.
· 25.08
878 тестов за полгода — красноречиво показывает, как агенты снимают рутину с людей. У меня похожая логика в другом деле: вместо ручного ресёрча по компании и её людям перед B2B-заходом собираю досье через агентов за минуты. Любопытно, как вы распределяли задачи между агентами и ревью — по какому принципу решали, что доверить ИИ, а что оставить человеку?
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён
· 25.08
Тут все просто, агентов 8. И их работа идет по этапам.
Родительская сессия -> Лид тестирования(1) Ресерчер(2) -> лид вызывает его первым и тот собирает материал для написания пвтотестов. Тест- дизайнер(3) -> идет следующим и на основе собранного материала создает тестовую модель под фичу и пишет тест-кейсы Автоматиматизатор мобильный (4) -> идет после дизайнера и на основе документов и тест-кейсов пишет автотесты. Автоматизатор веб(5) -> работает так же как мобильный, но с уклоном в другой стек Ревьювер(6) -> проверяет написанный код на соотвествие паттернам и кодстилю. Девопс(7) -> поднимает окружение под прогон АТ/собирает apk Тестер(8) -> гоняет тесты и выдает вердик лиду Лид -> на основе вердикта или возвращает автотесты на доработку, либо возвращает задачу. Формируя отчет.
Валидацию из работы проводят детерминированные скрипты на всех этапах, а потом человек проводит ревью отчета и написанного кода.
Выстроил своего рода harness но для автоматизации тестирования.
Подробнее можно почитать В статье на хабре )
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён