🏆 Claude Opus 4.5 возглавил SWE-rebench
Anthropic достиг нового рекорда в бенчмарке для ИИ-программистов.
SWE-rebench использует 48 реальных задач из GitHub — issues и pull requests, чтобы исключить контаминацию. Лидером стал Claude Opus 4.5 с результатом 63,3%. Второе место у GPT-5.2 (61,5%), третье — у Gemini 3 Flash (60%). При этом стоимость решения одной задачи у Gemini всего $0,29 против $1,22 у Opus.
Среди open-source моделей сильнее всех — китайская GLM-4.7 с 51,3%.