“У Алисы X братьев и Y сестёр. Сколько сестёр у брата Алисы?”

Что ответили популярные LLM?

Этот вопрос исследователи задавали современным моделям, чтобы оценить их способности к рациональному мышлению. В эксперименте принимали участие в том числе GPT-4, Claude 3, Mistral и Llama*.

В статье пробовались разные комбинации чисел, подставленных вместо X и Y.

Использовали три стратегии промптинга:

1️⃣ Standard. Содержался просто вопрос без дополнительных данных 2️⃣ Thinking. Модель просили внимательно подумать перед ответом и два раза перепроверить его на предмет ошибок 3️⃣ Restricted. LLM должна была дать только финальный ответ без дополнительного текста

Результаты оказались ошеломляющими:

📌 несмотря на отличные показатели на многих стандартизованных бенчмарках (MMLU, GSM8K), модели часто не могли ответить на вопрос 😔 📌 если им случайно удавалось решить задачу, LLM не справлялись с внятным объяснением хода размышлений 📌 модели большего размера иногда не промазывали. При этом в ответах часто оказывались излишне самоуверенными и генерировали абсурдные, но убедительные объяснения для неправильных ответов (это должно стать предметом пристального внимания специалистов по AI-safety) 🆘

Работа показывает острую необходимость в переразработке бенчмарков для тестирования способностей моделей к рациональному мышлению ⏱ Возникает ситуация, при которой оценка LLM может не отражать реального положения вещей.

  • продукт экстремистской организации, деятельность которой запрещена на территории РФ