Галлюцинации LLM

Критерий в промпте судьи: как одна фраза про «что считать галлюцинацией» меняет оценку ответов LLM **Суть метода** Исследование вскрывает системную ошибку в оценке галлюцинаций LLM: путаницу между *верностью источнику* (reference faithfulness) и *фактической корректностью* (factual correctness). Автоматические судьи часто маркируют развернутые, но верные ответы как галлюцинации только потому, что в них есть детали, отсутствующие в коротком эталоне. Смена фокуса промпта с «строгого следования эталону» на «отсутствие фактических ошибок» радикально снижает количество ложных срабатываний. **Как это работает** 1. **Диагностика**: берется пара «вопрос – эталонный ответ» и ответ LLM. 2. **Разделение критериев**: - *Верность*: любое утверждение, не вытекающее напрямую из эталона = галлюцинация. - *Факты*: галлюцинация = только прямое противоречие эталону или объективная ложь. 3. **Оценка**: LLM-судья проверяет ответ не на лексическое совпадение, а на наличие проверяемых ложных утверждений, игнорируя безопасные фактические дополнения. **Пример применения** - **Вопрос**: Какого цвета были античные статуи при создании? - **Эталон**: Яркие цвета. - **Ответ LLM**: Статуи были окрашены в яркие цвета, включая красный, синий и золотой. Древние греки использовали технику полихромии. - **Судья (верность)**: ❌ Галлюцинация (про «синий, золотой и полихромию» в эталоне нет). - **Судья (факты)**: ✅ Не галлюцинация (информация верна и не противоречит эталону). **Шаблон промпта для LLM-судьи** ```text Ты — аудитор фактической корректности ответов ИИ в задачах open-domain QA. Твоя задача: определить, содержит ли ответ модели галлюцинацию, сравнивая его с эталоном. ОПРЕДЕЛЕНИЕ: Галлюцинация — это утверждение, которое противоречит эталонному ответу или является фактически ложным в проверяемой детали (дата, имя, событие, свойство). ВАЖНО: Информация, отсутствующая в эталонном ответе, НЕ считается галлюцинацией, если она фактически верна и не противоречит эталону. ФОРМАТ ОТВЕТА (строго JSON): {"label": 0 или 1, "confidence": <число от 0 до 1>} Правила: - 1 = галлюцинация, 0 = нет галлюцинации. - Никакого markdown, рассуждений или лишнего текста, только валидный JSON. ``` **Границы применимости** - **Использовать**: при оценке open-domain QA, чат-ботов и ассистентов, где ценятся развернутые, информативные и фактически точные ответы. - **Не использовать**: в задачах RAG, суммаризации документов или строгом извлечении данных, где любая информация «от себя» (даже верная) нарушает требования к верности источнику (faithfulness) и является недопустимой. **Ключевые выводы из экспериментов** - Переход с промпта на «верность» на промпт «фактическая корректность» снижает долю ложных срабатываний (FP%) у LLM-судей с 80–99% до 35–50%, значительно повышая согласие с человеческой разметкой (Cohen’s κ). - Классические метрики (ROUGE-L, BERTScore) и NLI-модели работают плохо: ROUGE пропускает галлюцинации (много false negatives), а строгий NLI дает почти 99% ложных срабатываний. - Улучшение дает именно *смена критерия* в промпте, а не его усложнение или добавление структуры (проверено на факторном эксперименте). - Паттерн устойчив для разных моделей-судей (GPT-4/5, Claude, Llama, Qwen), хотя абсолютные значения согласия варьируются. Исследование: arXiv:2610.08026 Поддержать проект донатом: Сбер 2202 2084 9881 5282. Заранее спасибо.

Галлюцинации LLM | Сетка — социальная сеть от hh.ru