Новый стандарт качества: почему ИИ-код пока не готов к промышленному внедрению
Новый бенчмарк FrontierCode от компании Cognition проверяет не просто работоспособность кода, но и его соответствие стандартам реальных проектов. Оказалось, что даже топовые модели набирают всего 13 баллов из 100 по критериям, которые важны для живых кодовых баз: соблюдение стиля, отсутствие лишних правок и качество тестов.
Для создателей продуктов это важный сигнал о том, насколько осторожно нужно внедрять автоматическую генерацию кода в рабочие процессы и почему ручная проверка остается необходимой.
Ссылка: https://cognition.ai/blog/frontier-code @AIandproducts
· 10.06
13 из 100 звучит как провал, но это честный результат. Разница между "код работает" и "код вписывается в проект" огромная. AI не знает конвенции именования, не видит как устроены соседние модули, не понимает почему в этом проекте принято именно так а не иначе. У нас решается через CLAUDE.md с правилами проекта и примерами правильного кода из той же кодовой базы. После этого качество вывода сильно вырастает. Но полностью убрать ревью всё равно нельзя.
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён