На Reddit уже появились жалобы, что GPT-5 «не очень». Но давайте посмотрим на данные из бенчмарков — тестов, где модели ИИ решают одни и те же задачи, чтобы можно было объективно сравнить их качество.
Бенчмарки бывают двух типов: ▶️Реальные бизнес-задачи — компании проверяют ИИ на тех задачах, которые нужны им в работе. ▶️Абстрактные тесты — искусственные задания, не всегда полезные в бизнесе, но помогающие понять технический уровень модели.
Как GPT-5 проявила себя в бизнес-задачах? 🔘Банковские операции — улучшение точности сверки выписок и извлечения данных о контрагентах на 15–38% по сравнению с GPT-4o.
🔘Код-ревью и поиск ошибок — 77,3% успешных решений против 26,7% у Claude Sonnet 4 и 44% у o3.
🔘End-to-end программирование в тестах Cognition (внутренний набор задач от компании-разработчика Devin; end-to-end значит «от постановки задачи до готового кода») — лучше Sonnet 4, +7% в планировании задач.
🔘На внутреннем бенчмарке Windsurf для задачи исправления багов модель показала прирост на 3–4% по метрике pass и на 12% по pass.
🔘Обработка документов — точность извлечения бизнес-сущностей выросла на 5% в среднем и на 9% на длинных документах. В задачах по работе с Excel точность выросла до 88% (против 78% у Gemini и Sonnet 4), а при заполнении страховых форм — до 86% (у Gemini те же 78%).
🔘JetBrains кодинг-тесты (Java/Kotlin, Go, Rust, включая закрытые репозитории) — на 20–100% лучше Claude.
🔘Поиск финансовых инсайтов — 83% против 79% у o3, 65% у Gemini и 62% у Claude.
Как модель показала себя в абст[рактных тестах?
🟡Понима](https://x.com/gsivulka/status/1953502133912748305)ние физики по картинкам (Visual Physics Comprehension) — 66% точности, у Gemini — 48%, у Claude — 39%.
🟡IFScale — ответы с сотнями ограничений и инструкций, более 90% успеха при 500+ инструкциях в контексте (у Gemini 2.5 — 70%).
🟡Длинный контекст (документы до 100 тыс. токенов) — 76% точности против 68% у Grok 4 и ~66% у Gemini / Claude. 🟡Снижение галлюцинаций (выдуманных фактов) — 10,3% ошибок против 12,4% у Gemini и 13,2% у Sonnet.
🟡Бизнес-задачи разных отраслей (бенчмарк Рината) — 79,4% против 74% у Gemini и 71% у Claude 3.7. Бенчмарк сильно устрел...
🟡LiveCodeBenchPro (свежие задачи с Codeforces) — Elo-рейтинг 2296 против 1585 у Gemini.
🟡WeirdML-v2 (нестандартные ML-задачи) — 56,3% против 50% у Gemini и 45,3% у Claude Sonnet.
GPT-5 действительно сильная, но это не значит, что она всегда лучше предыдущих моделей. В некоторых задачах o3 или GPT-4.1 всё ещё впереди. Есть и субъективный момент: даже если GPT-5 даёт больше хороших ответов в среднем, при сравнении парных ответов вы можете иногда выбирать старую модель. Это связано с тем, что у вас сохраняется «память» о старых удачных случаях, и даже небольшое снижение качества в знакомых задачах может казаться заметным.
Простой пример: если GPT-4o давала хороший ответ в 30% случаев, а GPT-5 — в 60%, то при сравнении ответов «в лоб» примерно в трети случаев вы всё равно выберете старую версию.
А ещё — эффект больших чисел. При 700 млн пользователей, если у 1% из них опыт стал хуже, и только 1% из этих людей напишет об этом, в сети появится уже 70 тысяч жалоб. Они будут заметны, даже если в среднем модель стала лучше.
😎 GPT-5 дешевле не только o3, но и моделей Anthropic. А за счёт обновлённого кэширования (повторного использования уже обработанных данных) скидка теперь не 50%, а 90%.
В этом посте были ссылки, но мы их удалили по правилам Сетки