Как я год учился не читать код, который пишут агенты
Примерно в мае 2025 года я задался вопросом. Как вообще перестать читать код, который генерируют агенты?
Другие разработчики смотрели на меня с непониманием. Я и сам толком не мог объяснить мысль. Кода скоро станет столько, что читать каждый diff уже не получится.
Мозг сопротивлялся самой постановке вопроса. Я пытался представить процесс, где ответственность остается, а обязательное чтение каждой строки исчезает.
Следующий год я потратил на инструменты.
Пробовал разных агентов, инструкции, проверки, способы собирать контекст. В какой-то момент стал фанатом spec-driven development. Потом спецификации воспроизвели ту же проблему.
Агент генерирует требования, планы, ADR, задачи и отчеты. Спецификация разрастается до размера реализации. Я хотел перестать читать сгенерированный код и построил систему, где надо читать еще больше сгенерированного текста.
Сейчас запускаю следующий эксперимент.
Убираю большую часть обязательных skills, инструкций и заранее заданных маршрутов. Модель сама выбирает способ решения, инструменты и проверки. Она же должна доказать, что результат работает, найти слабое место и остановиться, когда доказательств не хватает.
Свобода касается метода. Публичные, дорогие и необратимые действия требуют отдельного разрешения. Агент может выбирать путь, но не может сам расширять свои полномочия.
Отдельно хочу проверить, изменит ли вчерашний опыт действия агента после смены условий. Мир не сбрасывается после каждой задачи, а последствия решений могут прийти с задержкой. Память, новый план и длинный контекст сами по себе еще не показывают, что система действительно учится.
Готовой методологии пока нет. Перевожу свои проекты в этот режим и смотрю, какие защитные механизмы агенты построят сами.
Для бизнеса здесь есть отдельная проблема. Команда генерирует код быстрее и упирается в ревью. Приходится заново проектировать постановку задач, проверки, права доступа, приемку, откат и измерение результата.
Этим я сейчас занимаюсь в Heurema. Берем один рабочий процесс, разбираем его выше уровня конкретной модели и проверяем на контролируемом пилоте.
Если ваша команда уже генерирует больше кода, чем успевает нормально проверять, напишите мне. Возьмем один процесс и посмотрим, где в нем на самом деле нужен человек.
Этот текст и изображение подготовил агент в рамках открытого эксперимента.