Исследование OpenAI: Измерение производительности AI-моделей на реальных задачах
OpenAI разработали GDPval - новую систему оценки, которая отслеживает, насколько эффективно ИИ-модели выполняют задачи, имеющие реальную экономическую ценность.
Название "GDPval" происходит от термина Gross Domestic Product - ключевого экономического показателя и оценивает, как модели справляются с реальными рабочими задачами опытных профессионалов из множества отраслей, показывая, насколько хорошо ИИ выполняет экономически значимую работу.
Первая версия GDPval охватывает 44 профессии из 9 отраслей, которые вносят наибольший вклад в ВВП США. В общей сложности - 1 320 специализированных заданий, из них 220 доступны в открытом доступе (“эталонный набор”).
Каждое задание создано и проверено экспертами с 14 годами опыта (в среднем). Примеры реальных типов заданий: юридическое заключение, инженерный чертёж, диалог службы поддержки, план ухода за пациентом.
Критерий: если 60% и более задач профессии - не физическая работа, она считается "познавательной". Так сформировались 44 профессии - от юристов и медсестёр до инженеров и журналистов.
Для каждой профессии приглашались опытные специалисты, которые формулировали реалистичные задания из своей практики. Задания проходили до 5 раундов экспертной проверки - другими специалистами и автоматизированными системами.
Результаты: 🟢 Claude Opus 4.1 показал лучшие результаты, особенно по дизайну и оформлению 🟢 GPT-5 лидировал по точности и фактической корректности решений 🟢 прогресс с весны 2024 (GPT-4o) до лета 2025 (GPT-5) - качество выполнения задач выросло в три раза
Кроме того, модели выполняли задания в 100 раз быстрее и дешевле, чем эксперты. Правда, это не учитывает время на проверку, итерации и интеграцию результатов в реальной работе.
Доля задач, где результат лучше или равен человеческому: 🟢GPT-4o - 12.4% 🟢o3 high - 25.5% 🟢o4-mini - 27.9% 🟢Gemini 2.5 Pro - 34.1% 🟢Grok 4 - 24.3% 🟢 GPT-5 - 47.6% 🟢Claude Opus 4.1 - 50%
Результаты GDPval показывают, что модели уже могут брать на себя повторяющиеся и чётко определённые задачи, выполняя их быстрее и дешевле.
GDPval пока что оценивает одноразовые задачи, без итераций и контекстного диалога. Будущие версии включат больше профессий и отраслей, задачи с неоднозначными вводными, интерактивные сценарии (например, редактирование отчёта после обратной связи).
Долгосрочная цель - точнее измерять прогресс ИИ в сфере умственного труда.