Проблемы в оценке навыков программирования у ИИ

Компания OpenAI отозвала свои рекомендации по использованию SWE-Bench Pro — основного теста, по которому индустрия оценивала качество написания кода нейросетями. Аудит показал, что около 30% заданий теста некорректны: они содержат противоречивые инструкции или невыполнимые требования.

Это означает, что недавние рекорды моделей в разработке софта могли быть завышены, и рынку требуются новые, более надежные критерии оценки эффективности инструментов автоматизации кодинга.

Ссылка: https://openai.com/index/separating-signal-from-noise-coding-evaluations/ @AIandproducts