Как проверить, что смысл не поменялся при правке текста LLM
Similarity Gates.
Что это за метод? Проблема: эмбеддинг‑схожесть (cosine‑score) считает «не‑поменялась» даже если смысл перевернут – например, “не давать препарат” → “давать препарат”. Идея: вместо одного абстрактного балла задаём конкретные бинарные вопросы по маркерам полярности: отрицание/разрешение, обязательность, числовые параметры, направление действия.
Как это работает 1. Выбираем категории (полярность, модальность, количество, направление). Для юридических договоров – «обязательства и сроки», для медицинских – «дозировка/противопоказания», для промптов – «направление инструкции». 2. Подаём два текста (оригинал + правка) в LLM с запросом: «Не давай общую оценку похожести. Проверь по каждому пункту отдельно и явно…» 3. Модель выдаёт таблицу/список с вердиктами «ИЗМЕНИЛОСЬ / НЕ ИЗМЕНИЛОСЬ» + цитату, подтверждающую изменение. 4. Если хотя бы один пункт изменён – считаем тексты не эквивалентны.
Шаблон промпта Проверь два текста на изменение смысла. Не давай общую оценку похожести, а задай конкретные вопросы: 1. Изменилась ли полярность (разрешение/запрет, включение/исключение)? 2. Изменилась ли обязательность (должен/может/не обязан)? 3. Изменились ли числа, сроки, единицы измерения? 4. Появилось/исчезло ли отрицание? Для каждого пункта дай вердикт: ИЗМЕНИЛОСЬ / НЕ ИЗМЕНИЛОСЬ + точную цитату. Текст А: {текст_оригинал} Текст Б: {текст_правка}
Пример применения Контекст: юрист правит договор поставки, добавил формулировки в раздел об ответственности. Промпт: Проверь два текста на изменение смысла... Текст А: «При несвоевременной поставке Заказчик имеет право потребовать возврат уплаченных сумм.» Текст Б: «Если поставка не будет выполнена вовремя, Заказчик может требовать возврата уплаченных средств.» Ответ модели: • Полярность – НЕ ИЗМЕНИЛОСЬ – цитата: «не будет» → «не будет» • Обязательность – ИЗМЕНИЛОСЬ – цитата: «обязан» → «может» • Числа/сроки – НЕ ИЗМЕНИЛОСЬ • Отрицание – НЕ ИЗМЕНИЛОСЬ Результат: хотя тексты похожи, смысл изменился (обязательность).
Ограничения и риски Не универсален – работает только для проверки изменения смысла при правке, а не для оценки качества, стиля или креативности. Нет единого порога – числовой score похожести не надёжный; лучше использовать категориальный подход. Зависит от LLM – модель должна быть способна распознавать отрицания и модальность. При слабом понимании контекста ответы могут быть неточными. Только сравнение двух версий – метод не подходит для оценки оригинального текста без пары.
Ключевые выводы из экспериментов: На тестовом корпусе из 56 подмен смысла стандартные эмбеддинг‑гейты (оценка по косинусной близости) не обнаружили ни одного случая изменения смысла – результат 0 из 56. Применение категориального чек‑листа с проверкой по конкретным маркерам (полярность, обязательность, числа, отрицание) позволило выявить 100% всех смысловых искажений. Даже попытки улучшить модель – смена эмбеддингов, использование пересечения слов – не дали результата на текстах, написанных другим человеком. Стандартные методы оставались «слепы» к реальным изменениям смысла.
Итог: абстрактная оценка похожести ненадёжна. Только целенаправленная проверка ключевых смысловых маркеров даёт гарантированный результат.
Исследование номер 2608.10216 Поддержать проект донатом: Сбер 2202 2084 9881 5282. Заранее спасибо.