OpenAI рекомендует больше не оценивать модели своим бенчмарком SWE-bench Verified
SWE-bench Verified придумали в OpenAI в 2024 году, чтобы замерять способности LLM к программированию.
Теперь выяснилось, что все модели «видели» часть заданий и методы их решения во время своего обучения. А более половины задач в нём вообще прописаны некорректно.
OpenAI предлагает пользоваться бенчмарком SWE-Bench Pro. Он тоже не идеален, но результаты даёт поточнее.
https://openai.com/index/why-we-no-longer-evaluate-swe-bench-verified/