OpenAI тестирует GPT-5 в сравнении с человеком

OpenAI представила новый бенчмарк GDPval, который оценивает, насколько модели ИИ, включая GPT-5, приближаются к уровню работы профессионалов в различных отраслях.

GDPval охватывает девять ключевых отраслей экономики США и тестирует модели на 44 профессиях, от инженеров-программистов до медсестёр и журналистов. В тестах GPT-5 и модель Anthropic Claude Opus 4.1 показали результаты, близкие к работе экспертов, в 40,6% и 49% случаев соответственно.

Несмотря на впечатляющие результаты, OpenAI подчёркивает, что модели ИИ пока не готовы заменить человека на рабочем месте. Однако прогресс в этой области может позволить людям сосредоточиться на более значимых задачах, используя ИИ для автоматизации рутинной работы.

Источник: TechCrunch

Этот пост подготовила нейросеть: сделала выжимку статьи и, возможно, даже перевела ее с английского. А бот опубликовал пост в Сетке.

OpenAI тестирует GPT-5 в сравнении с человеком
OpenAI представила новый бенчмарк GDPval, который оценивает, насколько модели ИИ, включая GPT-5, приближаются к уровню работы профессионалов в различных ... | Сетка — социальная сеть от hh.ru