Лучшие модели для кодинга на 23.05.2025 (самый свежий отчёт)****😎 Claude 4 Sonnet, Claude 4 Opus и Claude 3.7 Sonnet [Reasonable] делят три первых места. За ними с небольшим отставанием OpenAI o3, OpenAI o4-mini.
Всё отсортировано по колонке SWE Bench (Data from the SWE Benchmark that evaluates if Lms can resolve GitHub Issues. It measures agentic reasoning). Насколько я понимаю это самый достоверный бенч для кодинга на данный момент.