Semantic Bandits– как названия вариантов влияют на выбор LLM

Что это?

В классической задаче *многорукого бандита* модель пробует разные варианты, получает числовую награду и постепенно учится выбирать лучший. Исследование показало, что **LLM не «видит» только цифры** – она приписывает словам («лучший», «плохой», «хайповый») статистическую ценность, которую уже видела в обучающих текстах. Если слово совпадает с реальностью, модель быстро находит победителя; если нет – застревает на плохом варианте.

Как это работает

1. **Названия** - *Нейтральные* (буквы/номера) → модель полагается на цифры. - *Эмоциональные / ранговые* слова → модель «доверяет» слову больше, чем числам. 2. **Фидбек** - Негативный сигнал (минус) заставляет модель менять стратегию сильнее, чем позитивный того же размера. 3. **Инструкции** - Явное предупреждение о возможной обманчивости названий снижает влияние слов. - Команда «исследуй все варианты» повышает готовность пробовать даже невыгодные опции (но может тормозить, если слово уже совпадает с реальностью).

Практический шаблон промпта

Варианты: {список вариантов с нейтральными именами – "Вариант 1", "Вариант 2" и т.д.} Задача: {оптимизировать бюджет, стратегию, выбор товара и т.п.} История результатов: {вариант} → {результат} {вариант} → {результат}

Важно: названия вариантов могут быть случайными и не отражать реальную эффективность. Учитывай только фактические результаты из истории. Обязательно пробуй разные варианты в течение серии решений – не зацикливайся на одном, даже если он кажется явно лучшим. Какой вариант выбрать дальше? Объясни рассуждение по цифрам. ``` *Заполняй поля конкретными данными вашей задачи.*

Пример применения

| День | Вариант 1 (CTR/Conv) | Вариант 2 (CTR/Conv) | Вариант 3 (CTR/Conv) | |------|-----------------------|-----------------------|-----------------------| | 1 | 1.2 % / 0.3 % | 2.8 % / 1.1 % | 3.5 % / 1.6 % | **Плохой промпт (с эмоциональным названием)** > «Хайповый» креатив будет продолжать получать бюджет, даже если цифры показывают, что «Скучный» лучше. **Исправленный промпт (нейтральные имена + предупреждение)** > Модель выберет **Вариант 3**, основываясь только на числах, и будет пересматривать выбор при изменении данных.

Ограничения

- **Дебайсинг не бесплатен** – команда «исследуй все варианты» может замедлить работу, если слово уже совпадает с реальностью. - Эффект зависит от модели: Gemini более устойчив к словесным ловушкам, другие (OLMo, Qwen3) требуют явной подсказки. - На сложных многошаговых сценариях эффект может усиливаться или ослабевать – пока нет данных.

Ключевые выводы

| Показатель | Результат | |------------|-----------| | Нейтральные названия → почти как классический UCB1. | ✔️ | | Эмоциональные слова → быстрый успех, если совпадают с реальностью; провал, если нет. | ⚠️ | | Негативный фидбек более мощен, чем позитивный того же размера. | ⚡ |

**Поддержать проект донатом: Сбер 2202 2084 9881 5282. Заранее спасибо.** Номер исследования: **2608.16707**