Новый стандарт качества: почему ИИ-код пока не готов к промышленному внедрению

Новый бенчмарк FrontierCode от компании Cognition проверяет не просто работоспособность кода, но и его соответствие стандартам реальных проектов. Оказалось, что даже топовые модели набирают всего 13 баллов из 100 по критериям, которые важны для живых кодовых баз: соблюдение стиля, отсутствие лишних правок и качество тестов.

Для создателей продуктов это важный сигнал о том, насколько осторожно нужно внедрять автоматическую генерацию кода в рабочие процессы и почему ручная проверка остается необходимой.

Ссылка: https://cognition.ai/blog/frontier-code @AIandproducts