Код-ревью в эпоху ИИ: как агенты меняют проверку кода

На работе пулл-реквестов стало больше, они стали заметно объёмнее. Каждый последующий аппрув я ставлю с меньшей уверенностью.

В предыдущем ресёрче про coding agents и SDLC я разбирался, как и почему проверка кода становится узким местом в разработке. А теперь я решил отдельно посмотреть, что происходит с код-ревью.

Мне стало интересно: а что же сейчас происходит с код-ревью как процессом? Продолжают ли люди отсматривать построчно пулл-реквесты, сделанные агентами, или ставят аппрувы не глядя? И на что в итоге это влияет?

Лично я уже смещаю внимание на спецификации, архитектуру, контракты и интеграционные тесты. Насколько такой подход сохраняет качество и передачу знаний, я пока не могу оценить.

Из этих проблем и вырос мой новый ресёрч о том, как происходит код-ревью в эпоху ИИ. Вот несколько интересных тезисов:

➡️ AI-ревью на первом круге: полезные замечания есть, но экономию времени человека подтвердили далеко не везде. В A/B-тесте Google значимого ускорения ревью не нашли.

➡️ Аппрув и глубина проверки: в одной выборке люди чаще одобряют агентские PR и меньше комментируют. Это ещё не доказывает ухудшения качества, потому что дефекты за аппрувами не измеряли.

➡️ Проверка после мерджа: появляются данные о последующих исправлениях и откатах. Результаты различаются между агентами, свести всё к «AI-код хуже» не получится.

➡️ Передача знаний: человеческое ревью обсуждает контекст и помогает команде понимать систему. В агентских комментариях эти функции почти отсутствуют. Долгосрочный эффект для роста junior пока неизвестен.

В ресёрче я разбираю, что исследования уже показывают о пользе AI-ревью, поведении людей и исправлениях после мерджа. И объясняю, как меняю собственную проверку под выросший поток PR и какие последствия ещё предстоит измерить.

// Если прочитали — поделитесь, пожалуйста, обратной связью, был ли вам полезен и интересен ресёрч. Хочу сделать будущие публикации лучше :)