Проблемы в оценке навыков программирования у ИИ
Компания OpenAI отозвала свои рекомендации по использованию SWE-Bench Pro — основного теста, по которому индустрия оценивала качество написания кода нейросетями. Аудит показал, что около 30% заданий теста некорректны: они содержат противоречивые инструкции или невыполнимые требования.
Это означает, что недавние рекорды моделей в разработке софта могли быть завышены, и рынку требуются новые, более надежные критерии оценки эффективности инструментов автоматизации кодинга.
Ссылка: https://openai.com/index/separating-signal-from-noise-coding-evaluations/ @AIandproducts