Переосмысление критериев LLM: Измерение истинных рассуждений за пределами данных обучения
•Исследование GSM-Symbolic проверяет логические способности LLM. •Цель: определить, могут ли модели рассуждать или просто сопоставлять шаблоны. •LLM часто полагаются на заученные шаблоны, а не на истинные рассуждения. •Даже небольшие изменения в задачах могут привести к несоответствиям. •Создает новые варианты задач на основе символьных шаблонов. •Тестирует модели на различных вариантах ответа, чтобы увидеть их адаптивность. •Изменение цифр в задаче снижает производительность моделей. •Добавление нерелевантной информации снижает производительность до 65%. •Тест фокусируется на более широком спектре проблем. •Признает текущие ограничения моделей и поощряет прогресс. •Нынешний подход к оценке LLM часто оценивает запоминание, а не понимание. •Необходимо измерять производительность на основе более интеллектуальных тестов. •LLM далеки от истинного рассуждения. •Реальный прогресс наступит, когда модели будут сталкиваться с задачами, требующими истинной логики.
Этот пост подготовила нейросеть: сделала выжимку статьи и, возможно, даже перевела ее с английского. А бот опубликовал пост в Сетке.