Повышение точности оценки LLM

**Relevance‑Contrast Context (RCC)** – метод повышения точности оценки важности пунктов в списке, когда LLM получает «шум» того же домена.

Что делает RCC

- **Проблема:** если в промпт передавать только важные элементы, модель начинает считать всё важным, потому что у неё нет эталона «неважного». - **Решение:** добавить к списку случайный набор неважных пунктов того же типа. Это даёт модели контраст и позволяет ей лучше масштабировать оценку.

Как работает

1. **Сбор данных** – список всех элементов (письма, сообщения, задачи). 2. **Подготовка «шумного» набора** – 30–50 % пунктов из того же домена, но явно неважных (закрытые вопросы, рутинные чаты). 3. **Объединение** – смешанный список фиксированного размера (обычно 10‑15 элементов) отправляется в один запрос LLM. 4. **Оценка важности** – модель выдаёт баллы (0–3) для каждого пункта. 5. **Фильтрация** – выводятся только элементы с оценкой ≥ 2, отсортированные по значению.

Пример промпта

Ты анализируешь сообщения команды за сегодня. Критерий важности: «требует решения/действия в течение дня». Список (10 пунктов): 1. Письмо от клиента о задержке поставки – важно 2. Рутинный вопрос о статусе задачи #123 – неважно 3. Уведомление о выходе новой версии ПО – важно 4. Обсуждение темы кофе‑брейка – неважно 5. Запрос на обновление бюджета – важно 6. Вопрос про правила оформления документов – неважно 7. Напоминание об оплате счета – важно 8. Пожелания коллеги по поводу праздника – неважно 9. Инструкция по настройке VPN – важно 10. Сообщение о погоде в офисе – неважно Оцени каждый пункт по шкале: 0 — не относится, 1 — упомянуто без действия, 2 — стоит знать, 3 — требует решения сегодня. Выведи только пункты с оценкой 2‑3, отсортированные по важности.

Шаблон для копирования

Ты анализируешь {тип_контента} за {период}. Критерий важности: {критерий_важности}. Список (фиксированный размер, 10‑15 пунктов): {вставить пункты} Оцени каждый пункт по шкале: 0 — не относится к работе 1 — упомянуто без решения/действия 2 — стоит знать, но не критично 3 — требует решения/действия сегодня Выведи только пункты с оценкой 2‑3, отсортированные по важности.

Ограничения и риски

- **Тип контента:** эффект заметен для писем (низкая доля важных), почти нулевой для чатов/встреч, где важно уже много. - **Длина списка:** при < 10‑15 пунктах порядок мало влияет; при > 30 пунктов важные могут «затеряться» – вынесите критичное в начало/конец. - **Модели с глубоким рассуждением:** эффект может исчезнуть (Claude + reasoning). Лучше использовать модели без режима “рассуждения”. - **Шум должен быть того же домена** – случайный текст из другого контекста не помогает и может ухудшить результат.

Ключевые выводы

| Параметр | Результат | |----------|-----------| | 30–50 % «неважного» в списке | +15‑25 % точности оценки важности (среднее по моделям) | | Только важные пункты | Модель переоценивает все как важное, снижая различие | | Различные модели | Эффект устойчивый, но слабее у моделей с reasoning |

**Поддержать проект донатом: Сбер 2202 2084 9881 5282. Заранее спасибо.** Номер исследования: 2608.17188