🏆 Claude Opus 4.5 возглавил SWE-rebench

Anthropic достиг нового рекорда в бенчмарке для ИИ-программистов.

SWE-rebench использует 48 реальных задач из GitHub — issues и pull requests, чтобы исключить контаминацию. Лидером стал Claude Opus 4.5 с результатом 63,3%. Второе место у GPT-5.2 (61,5%), третье — у Gemini 3 Flash (60%). При этом стоимость решения одной задачи у Gemini всего $0,29 против $1,22 у Opus.

Среди open-source моделей сильнее всех — китайская GLM-4.7 с 51,3%.

#ai #swe_rebench #claude #gpt #gemini #llm

🏆 Claude Opus 4.5 возглавил SWE-rebench
Anthropic достиг нового рекорда в бенчмарке для ИИ-программистов | Сетка — социальная сеть от hh.ru