Как LinkedIn построил AI Code Review на всю компанию
Последнее время читаю столько хороших технических материалов, что даже подумываю возродить ТехноФитнес — в основной блог они просто не влезают. Сегодня хочу поделиться шикарной статьёй о том, как в LinkedIn построили AI Code Review.
С распространением AI-агентов разработчики начинают писать больше кода, и bottleneck постепенно переезжает в Code Review. В LinkedIn это стало видно по росту P90 времени до первого человеческого ревью. А масштаб там огромный: больше 10к активных репозиториев и десятки тысяч PR в неделю.
Для меня как для руководителя разработки эта тема особенно важна. Если ускорить написание кода, но не масштабировать контроль качества, то либо появится огромная очередь из изменений, либо требования к ревью начнут деградировать (все же делали LGTM на 5к строк, да?). А дальше кодовая база довольно быстро поедет куда-то не туда.
Инженеры из LinkedIn поэтому построили собственную multi-agent систему AI Code Review. Сейчас она делает 79к ревью в неделю примерно по 40к PR, а её рекомендации принимаются разработчиками в 63,9% случаев.
⭐️ Интересные идеи ➡️ Мультиагентное ревью. Главная проблема AI Code Review — не найти максимум замечаний, а не заспамить разработчика мусором. Поэтому несколько независимых агентов параллельно ревьюят PR, а оркестратор объединяет и перепроверяет результаты. Совпадение между моделями повышает confidence. Цена — больше токенов, вычислений и latency.
➡️ Контекст кодовой базы важен. Хороший AI Reviewer должен знать не только язык, но и конкретную систему. В LinkedIn для этого используют трёхуровневую систему правил: глобальные, репозиторные и use-case-specific. Отсюда неприятный вывод: качество AI Review напрямую упирается в качество формализованных знаний о системе (пиши доки, бл&ть!).
➡️ AI Reviewer – это отдельная инженерная система. У него есть SLA, observability, staged rollout и eval перед изменениями. Ревью стартует примерно через 90 секунд, большинство проверок заканчивается меньше чем за 10 минут. Лайки под комментариями авторы считают vanity metric. Вместо этого они проверяют, внёс ли разработчик рекомендацию в merged code. На выборке из 5230 комментариев в 90,1% случаев удалось уверенно определить результат. При этом acceptance rate для logic errors достигает 80%, а для concurrency bugs в их выборке вообще был 100%.
➡️ Feedback loop из продовых инцидентов. LinkedIn хочет анализировать SEV0/SEV1-инциденты и автоматически превращать найденные failure patterns в новые правила Code Review. Получается замкнутый цикл: сломали прод → разобрали причину → научили reviewer ловить похожую ошибку до мержа.
Статья хорошо подтверждает моё ощущение: в AI-first разработке Code Review превращается из ботика-комментатора в полноценный платформенный инструмент. И без такого слоя масштабировать AI-разработку нормально не получится.
Приятного чтения!
➖➖➖➖➖➖➖➖➖➖➖ 📝 @ulshinblog
· 17.08
мультиагентная оркестрация — это красиво, но до масштаба linkedin 80% эффекта даёт просто pr-agent от codium с нормально прописанными repo-level правилами в .pr_agent.toml. весь хайп вокруг multi-agent ревью разбивается о то, что без качественных правил по конкретной кодовой базе любая модель несёт generic мусор, и это как раз тот случай, когда скучный конфиг-файл важнее архитектуры
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён