Самая новая и мощная модель ChatGPT, o1-preview, даёт 57% неправильных ответов, — внутренний тест OpenAI.
GPT-4o — 60% неверных ответов Claude-3.5-sonnet — 71,1% неверных ответов
Как считали? В OpenAI создали тест из 4326 вопросов на темы от кино и науки до географии и технологий.
У каждого вопроса строго 1 правильный ответ и модели проверяли на способность точно и уверенно отвечать.
это провал 😕
@concertzaal