Вышли новые ChatGPT и Claude: Кто победил?
За две недели вышли две новые флагманские нейросети: 9 июля GPT-5.6 от OpenAI, 24 июля Claude Opus 5 от Anthropic. Обе компании объявили себя лидерами.
Я полез сверять цифры по первоисточникам — и нашёл в популярных сравнениях системные искажения. Рассказываю, потому что на этих таблицах люди принимают решения о бюджетах.
Три типовые подмены
1. В сравнениях у GPT-5.6 Sol указывают BrowseComp 92,2% и Terminal-Bench 91,9%. Но в официальной таблице OpenAI это результаты режима Ultra, где параллельно работают четыре агента. Базовый Sol даёт 90,4% и 88,8%. Сравнивать четырёхагентный режим с одиночным запуском конкурента — это как сравнивать бригаду с одним рабочим.
2. В одном агрегаторе у флагмана Sol стоит индекс кодинга 77,4. По таблице самой OpenAI это результат Terra — средней модели. У Sol там 80.
3. Даже одинаково названный тест вендоры считают по-разному. OpenAI прямо пишет в сноске: их подсчёт по HealthBench несопоставим с методикой Anthropic. И главное: страница OpenAI опубликована 9 июля — за 15 дней до выхода Opus 5. Все её сравнения с Claude сделаны против предыдущего поколения. Просто потому, что нового тогда не существовало.
Вывод: прямого сопоставимого сравнения этих моделей не существует. Есть два набора вендорских замеров на разных стендах.
Где кто сильнее, если брать только сопоставимое
Opus 5 впереди на реальных кодовых базах (SWE-bench Pro: 79,2% против 64,6%), на управлении компьютером (OSWorld 2.0: 70,6% против 62,6%), на доведении бизнес-процессов до конца (AutomationBench: 26% против 18,1%) и на принципиально новых задачах (ARC-AGI-3: около 30% против 7,78%). GPT-5.6 сильна на академических знаниях (GPQA Diamond 94,6%), математике (FrontierMath 89%), мультимодальности и кибербезопасности. Плюс даёт лестницу из трёх моделей разной цены.
Цены за миллион токенов: Opus 5 — $5 вход / $25 выход. GPT-5.6 Sol — $5/$30, Terra — $2,50/$15, Luna — $1/$6.
Что это значит на практике
Считать надо не цену за токен, а цену за принятую задачу — с учётом повторов при провале и времени сотрудника на проверку. Дорогая модель, решающая с первого раза и коротко, часто выходит дешевле болтливой дешёвой.
Мои ориентиры по задачам:
Поток типовых документов, массовая рутина — Luna. Разница с флагманом пятикратная, а качество упирается в исходники, а не в модель.
Поддержка первой линии — Terra с эскалацией на флагман. Важнее модели тут правило эскалации: по какому признаку обращение уходит выше.
Агент, доводящий процесс до конца сам — Opus 5. Стартуйте с medium усилия, максимальное на всех запросах — самый частый способ сжечь бюджет.
Разбор большой кодовой базы, легаси, плавающие баги — Opus 5, разрыв в 15 пунктов слишком велик.
Наука, математика, работа с изображениями — GPT-5.6.
Задачи по безопасности — GPT-5.6, и это вопрос политики: Anthropic намеренно ограничивает эти сценарии.
И общий совет: не привязывайте продукт к одному вендору жёстко. Держите слой маршрутизации, где модель меняется настройкой, а не переписыванием кода. Логируйте, какая модель на каком запросе отработала, во что обошлась и был ли результат принят.
Через месяц эти логи ответят на вопрос выбора точнее любой статьи, включая эту.