Параллельно растёт детализация. Типичный апрельский отчёт — 170+ строк таблицы со сценариями. В январе — 120 строк общего описания. Структура жёстче, проверки по таблице, severity рядом с каждым багом.
🛠 Промпты эволюционируют: 3000+ строк инструкций Сейчас у четырёх ролей (координатор + три исполнителя):
• qa-manager.md — 667 строк, 56 КБ — последняя правка сегодня • qa-automator.md — 941 строка, 43 КБ • api-tester.md — 676 строк, 30 КБ • web-tester.md — 605 строк, 30 КБ
Итого ~2900 строк, 159 КБ инструкций. Каждая правка — это история ошибки, которую больше не должно случиться. Несколько примеров из последних правок:
• «Проверка браузера на шаге 3.5» — добавлено после случая, когда Web Tester ушёл работать в нерабочий MCP и вернулся через 20 минут с пустыми результатами. • «Обработка блокеров» — отдельный шаг 4.5, потому что менеджеры пытались сглаживать критические баги формулировками. • «Тестируй эффект, а не CRUD» — повторено в 5 местах в разных формулировках, всё равно агенты периодически генерят CRUD-тесты.
Промпты растут медленнее, чем кажется. За последний месяц — примерно +15% объёма. Большинство правок — переформулировки и уточнения, а не новые разделы. Это хороший признак: значит, костяк системы стабилизировался.
⏱ Сколько времени реально занимает одна /qa сессия Замерил по таймстемпам файлов внутри папок сессий. Медианная активная фаза (от первого файла до последнего, отбросив сессии больше суток — это пользователь возвращался):
• Март — 13 минут • Апрель — 50 минут
Парадокс: апрель медленнее марта. Объяснение простое — в марте /qa чаще запускался на простые задачи в один раунд. В апреле — на сложные мультираундовые сценарии. Если сравнивать в пересчёте на «единицу проверенной функциональности», апрель быстрее. Но эту единицу я измерять пока не научился.
Что точно: ручное тестирование тех же кейсов заняло бы дни. Самые сложные апрельские сессии — это два-три рабочих дня QA-инженера в сравнении состояний, ретесте после фиксов, проверке выгрузок построчно. У нас — 167 часов в фоне (6 раундов, неделя календарных дней), но из них активной работы человека — час суммарно. Только посмотреть отчёт и сказать «Да, можно в прод».
🎯 Что удивило 1. Агенты не задают вопросы. Мы зафиксировали правило в промпте, и агенты послушались. За апрель — 0 случаев, когда исполнитель прислал вопрос в чат. Только координатор спрашивает в самом начале, и то редко.
2. Discoveries.md появился сам. Я не закладывал этот паттерн с самого начала — он появился после того, как два агента дважды подряд впустую потратили время в параллели. Теперь это центральный компонент.
3. Размер промпта не пропорционален качеству. Самый большой промпт — у автоматора, и он чаще остальных косячит. Менее тяжёлые промпты тестеров — стабильнее. Дело не в объёме, а в чёткости границ ответственности.
4. Менеджер всё ещё иногда хочет сделать сам. Несмотря на 5 повторов в промпте, что нельзя делать curl. Приходится регулярно править. Это человеческое поведение модели — стремление помочь напрямую, минуя делегирование. Лечится только повторением правил.
🔁 Если хочется попробовать у себя В первом посте я давал чек-лист «как повторить». Добавлю одно: первые 2 месяца цифры будут плохими. Сессии будут рваться, агенты задавать вопросы, отчёты получаться неполными. Это нормально. Каждая такая ошибка — строка в промпте, которой раньше не было. Через месяц-два цифры начнут себя выправлять, и вы поймёте, что переехали в другой режим работы.
И главное - не пытайтесь сделать одного супер-агента с одним мега-промптом. Я пробовал. Это не работает на сложных задачах. Работает разделение ответственности и контракты между агентами через файлы.