LLM угадывает ответ, а не понимает.
**Суть метода** Исследование проверяет, обладают ли LLM структурированным, «человеческим» пониманием знаний на примере математики, используя Теорию пространств знаний (KST). KST утверждает, что знания иерархичны: освоение сложной темы требует освоения её пререквизитов. Авторы доказывают, что высокая точность LLM обманчива: их знания фрагментированы. Модели часто решают сложные задачи, проваливая базовые, и не умеют использовать пререквизиты для улучшения ответов, полагаясь на поверхностное сопоставление паттернов, а не на логический вывод. **Как это работает** 1. **Аннотация концептов**: Каждой задаче сопоставляются строгие учебные концепты (например, стандарты NYS) через LLM-промптинг. 2. **Построение зависимостей**: Если концепт А является пререквизитом для Б, задача на А становится пререквизитом для задачи на Б. 3. **Проверка трёх нормативных поведений**: - *NB1 (Удовлетворение пререквизитов)*: Если модель решила сложную задачу, она обязана решить и все базовые. Метрика: Prerequisite Satisfaction Ratio (PSR). - *NB2 (Эффект лесов)*: Добавление в промпт примеров решения пререквизитных задач должно повышать точность на целевой задаче сильнее, чем случайные или семантически похожие примеры. - *NB3 (Субсумпция)*: Знания более сильной модели должны полностью включать (покрывать) знания более слабой, как у сильных и слабых учеников. **Пример применения** Вы тестируете математического AI-тьютора. Вместо проверки только финального ответа на задачу «3x + 5 = 14», система автоматически генерирует и задаёт пререквизит: «x + 2 = 5». Если LLM решает первое, но валится на втором, это красный флаг: модель не рассуждает, а угадывает или использует поверхностные триггеры. Такой запрос требует изменения промптинга или дообучения на цепочках рассуждений. **Шаблон промпта для структурного рассуждения** ```text Ты решаешь задачу, строго опираясь на иерархию знаний. Целевая задача: {TARGET_QUESTION} Шаг 1. Выдели ключевые концепты задачи: {CONCEPTS} Шаг 2. Реши базовые пререквизиты (это обязательно): - Пререквизит 1: {PREREQ_QUESTION_1} - Пререквизит 2: {PREREQ_QUESTION_2} Шаг 3. Если шаги 1 и 2 верны, реши целевую задачу, явно ссылаясь на полученные промежуточные результаты. Не используй поверхностные аналогии. Ответ: ``` **Границы применимости** - **Полезно**: Для аудита reasoning-моделей, создания адаптивных обучающих систем, оценки того, не «галлюцинирует» ли модель правильный ответ через случайное совпадение. - **Бесполезно/вредно**: В доменах без чёткой иерархии знаний (креативное письмо, общие факты, открытые QA). Метод требует экспертных карт зависимостей концептов, которые сложно и дорого строить вне математики или точных наук. **Ключевые выводы из экспериментов** - Люди достигают **72.7%** идеального удовлетворения пререквизитов (PSR=1.0) при общей точности 79.6%. - Лучшая LLM (Qwen3-80B) при точности **92.5%** показала лишь **48.16%** PSR=1.0. - Подсказки с пререквизитами в контексте (few-shot) **не дают** системного преимущества перед случайными или семантически похожими примерами. LLM извлекают пользу из паттернов решения, а не из активации иерархии знаний. - Знания сильных LLM не покрывают знания слабых LLM, что говорит об отсутствии единой, последовательной структуры роста знаний у моделей (в отличие от людей). Исследование: https://arxiv.org/html/2609.05245v1 Поддержать проект донатом: Сбер 2202 2084 9881 5282. Заранее спасибо.