OpenAI рекомендует больше не оценивать модели своим бенчмарком SWE-bench Verified

SWE-bench Verified придумали в OpenAI в 2024 году, чтобы замерять способности LLM к программированию.

Теперь выяснилось, что все модели «видели» часть заданий и методы их решения во время своего обучения. А более половины задач в нём вообще прописаны некорректно.

OpenAI предлагает пользоваться бенчмарком SWE-Bench Pro. Он тоже не идеален, но результаты даёт поточнее.

https://openai.com/index/why-we-no-longer-evaluate-swe-bench-verified/