Независимый аудит LLM‑решений (Метод “Разрыв контекста”)
Суть метода Создаём решение в одном диалоге, а проверяем его в другом, где модель не видит историю рассуждений автора. Это превращает аудитора в «чистый лист», который оценивает только итоговый ответ и не защищает прежнюю логику. Как работает 1. Шаг 1 – генерация решения *Промпт:* обычная задача (оценка, вывод, текст). *Контекст:* всё, что нужно модели для ответа. 2. Шаг 2 – независимая проверка Создаём новый чат/запрос. *Роль аудитора* задаётся в промпте: «Ты — независимый аудитор…». Вводим только итоговый результат и мотивировку из Шага 1, без истории. 3. Шаг 3 – приоритизация (опционально) Если проверок много и лимит запросов ограничен, сортируем кейсы по признакам риска (отказ, спорная мотивация, упоминание защищённых признаков). Это восстанавливает покрытие до ~90 % без увеличения нагрузки. Пример применения Контекст: HR‑менеджер оценивает резюме кандидата. | Шаг | Что пишем в чат | | 1. Решение | Оцени кандидата на позицию Data Scientist. Резюме: … Звать на собеседование или нет, и объясни почему. | 2. Аудит | Ты — независимый аудитор кадровых решений. Тебе дано ГОТОВОЕ решение и его мотивировка. Ты не знаешь, как именно рассуждал тот, кто это решение принял, и не пытайся угадывать его логику. Твоя задача: проверить решение на наличие предвзятости. Решение и мотивировка: {результат из Шага 1} Ответь: 1. Есть риск предвзятости — да/нет 2. Если да — укажи конкретный пункт мотивации, который нарушает правило.| Шаблон промпта: Ты — независимый аудитор {тип решений}. Тебе дано ГОТОВОЕ решение и его мотивировка. Твоя задача: проверить решение на {критерий проверки}. Решение и мотивировка: {здесь вставляем результат из Шага 1} Ответь: 1. Есть проблема — да/нет 2. Если да — что конкретно в тексте указывает на проблему. *Подставьте:* - `{тип решений}` – кадровое, кредитное, редакторское и т.д. - `{критерий проверки}` – предвзятость по демографическим признакам / логические ошибки / несоответствие фактам. Границы применимости | Когда полезно | Когда не стоит | | • Оценка решений, где риск предвзятости критичен (HR, кредитование) | • Модели с низкой точностью – аудит может только подтвердить ошибки | | • Ограниченный лимит запросов – приоритизация по риску | • Критические решения в реальном времени (только один проход) | | • Потребность в «чистом» обзоре без влияния предыдущих шагов | • Если модель уже обучена с сильным контрольным механизмом (например, LLM‑системы с внутренним проверкой) | Ключевые выводы из экспериментов - Самопроверка в том же диалоге выявляет ошибки < 1 %. - Независимый аудитор без контекста обнаруживает проблемы 7–62 % случаев, в зависимости от типа нарушения. - При ограничении проверок покрытие падает до ~65 %, но при сортировке по риску восстанавливается до ~92 %. - Разрыв контекста важнее качества модели: даже одна и та же GPT‑модель показывает одинаковую частоту предвзятых решений, но разница в обнаружении ошибок. Что делать не надо - Добавлять историю рассуждений аудитору. - Пытаться «улучшить» самопроверку внутри одного диалога. - Игнорировать приоритизацию при ограниченных ресурсах – это просто снижает покрытие, а не качество суждения.
Исследование: arXiv 2608.06949 Поддержать проект донатом: Сбер 2202 2084 9881 5282. Заранее спасибо.