“У Алисы X братьев и Y сестёр. Сколько сестёр у брата Алисы?”
Что ответили популярные LLM?
Этот вопрос исследователи задавали современным моделям, чтобы оценить их способности к рациональному мышлению. В эксперименте принимали участие в том числе GPT-4, Claude 3, Mistral и Llama*.
В статье пробовались разные комбинации чисел, подставленных вместо X и Y.
Использовали три стратегии промптинга:
1️⃣ Standard. Содержался просто вопрос без дополнительных данных 2️⃣ Thinking. Модель просили внимательно подумать перед ответом и два раза перепроверить его на предмет ошибок 3️⃣ Restricted. LLM должна была дать только финальный ответ без дополнительного текста
Результаты оказались ошеломляющими:
📌 несмотря на отличные показатели на многих стандартизованных бенчмарках (MMLU, GSM8K), модели часто не могли ответить на вопрос 😔 📌 если им случайно удавалось решить задачу, LLM не справлялись с внятным объяснением хода размышлений 📌 модели большего размера иногда не промазывали. При этом в ответах часто оказывались излишне самоуверенными и генерировали абсурдные, но убедительные объяснения для неправильных ответов (это должно стать предметом пристального внимания специалистов по AI-safety) 🆘
Работа показывает острую необходимость в переразработке бенчмарков для тестирования способностей моделей к рациональному мышлению ⏱ Возникает ситуация, при которой оценка LLM может не отражать реального положения вещей.
- продукт экстремистской организации, деятельность которой запрещена на территории РФ
· 29.06.2024
Сонет 3,5 с первого раза ответил без танцев с бубнами
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён
· 29.06.2024
На сегодня это топовый продукт (Gemini 2 не успела к рейтингу)
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён