Самая новая и мощная модель ChatGPT, o1-preview, даёт 57% неправильных ответов, — внутренний тест OpenAI.

GPT-4o — 60% неверных ответов Claude-3.5-sonnet — 71,1% неверных ответов

Как считали? В OpenAI создали тест из 4326 вопросов на темы от кино и науки до географии и технологий.

У каждого вопроса строго 1 правильный ответ и модели проверяли на способность точно и уверенно отвечать.

это провал 😕

@concertzaal

Самая новая и мощная модель ChatGPT, o1-preview, даёт 57% неправильных ответов, — внутренний тест OpenAI.
GPT-4o — 60% неверных ответов
Claude-3 | Сетка — социальная сеть от hh.ru