Проверка документов с помощью LLM без «слепых пропусков».

Sharding (дробление чек‑листа) – техника, позволяющая LLM проверять документы без «слепых пропусков». Вместо одного запроса с сотнями критериев разбиваем их на небольшие группы (4–32 пункта), каждый раз передаём *полный* текст документа. Модель реально читает и цитирует доказательства, а не угадывает. 1. Как это работает | Шаг | Что делаем | Зачем | | 1 | Разбить чек‑лист на группы (4–32 пункта) | Сократить объём внимания модели за один запрос | | 2 | Для каждой группы отправляем запрос: «Текст документа + эти пункты» → вердикт + цитата | Модель фокусируется, проверяет каждый пункт по факту | | 3 | Собрать все ответы в таблицу | Получаем полный отчёт без пропусков | | 4 (опционально) | Для каждого «выполнено» запросить контраргумент («почему может быть не выполнено») | Защита от убедительных презентаций подрядчика/отчёта | | 5 | Сравнить аргументы «за» и «против», вынести финальный вердикт | Итоговый чек‑лист с рисками | 2. Шаблон промпта {ТЕКСТ_ДОКУМЕНТА} Проверь ТОЛЬКО эти пункты: 1. {Пункт 1} 2. {Пункт 2} ... N. {Пункт N} Для каждого пункта: - Приведи точную цитату из документа, подтверждающую или опровергающую условие - Вынеси вердикт: выполнено / не выполнено / нет данных (Повторить для каждой группы) 3. Финальный запрос Собери все вердикты в одну таблицу. Выдели красным пункты «не выполнено» и «нет данных». 4. Опционально Для каждого пункта, отмеченного «выполнено», найди контраргумент – почему условие может быть НЕ выполнено. 5. Сравни аргументы «за» и «против» и вынеси окончательный вердикт. 3. Практический кейс Задача: Проверка договора поставки по 30 пунктам (сроки, штрафы, форс‑мажор). 1. Разбиваем чек‑лист: группы по 5 пунктов → 6 запросов. 2. В каждом запросе вставляем полный договор + 5 пунктов. 3. Получаем таблицу из 30 строк с цитатами и вердиктами. 4. (Опционально) Запрашиваем контраргументы для «выполнено». 5. Финальный отчёт: риски в красном, рекомендации. 4. Когда метод полезен - Большой чек‑лист (> 20 пунктов) и/или длинный документ (> 10 к токенов). - Требуется высокая точность (юридические сделки, аудит). - Есть риск «убедительной» подачи со стороны проверяемого лица. 5. Когда не нужен - Чек‑лист короткий (< 15 пунктов) и модель мощная – один запрос уже справляется. - Критерии независимы друг от друга (простые фактчеки). - Ограниченный бюджет токенов: дробление удваивает количество сообщений. 6. Ограничения & риски | Ограничение | Что происходит | | Токены | Каждый запрос содержит полный документ → рост стоимости. | | Сложные взаимосвязи | Если пункт требует понимания контекста всей группы, дробление может потерять нюансы. | | Адаптивная атака | Убедительный аргумент по каждому пункту отдельно обходит шардинг; нужен шаг «оппонент». | 7. Экспериментальные результаты - Точность: при дроблении + цитировании выросла на ~30 % по сравнению с одним запросом, при том же суммарном бюджете токенов. - Атаки: цельная проверка пропускала до 70 % нарушений; шардинг почти полностью закрывал эту дыру (за исключением адаптивной атаки).

Исследование 2608.06422 Поддержать проект донатом: Сбер 2202 2084 9881 5282. Заранее спасибо.