Как имена влияют на выбор LLM и как это обойти.

Что изучали. Исследователи создали карточки пяти «врачей» с одинаковой специализацией, но разными рейтингами, ценами и **именами**, которые статистически сигнализируют пол/этническую принадлежность. Семь LLM (GPT‑4o‑mini + 6 открытых) оценили 40 068 вариантов. **Ключевой вывод:** *Имя влияет на выбор модели, но модель почти никогда не упоминает это в объяснении.* Рейтинг и цена работают предсказуемо: +0.8 % за каждый пункт рейтинга, –20 % за каждые 100 ₽ цены. Женские имена и «не‑белые» (латиноамериканские, южноазиатские, чернокожие) получали на 1–3 % больше шансов, чем «белые» мужские имена – обратный эффект от привычной дискриминации.

Как это работает

- **Обучение**: LLM видят огромное количество текстов, где имя связано с полом/национальностью. Эти связи закладываются в веса до того, как вы задаёте промпт. - **Генерация ответа**: Модель сначала «выбирает» вариант на уровне вероятностей (включая скрытый демографический сигнал), а потом генерирует текст‑объяснение. Текст‑объяснение не содержит упоминаний пола/национальности, потому что модель не «знает», что использовала имя при выборе.

Практический чек‑лист

1. **Подготовка карточек** - Замените имена на нейтральные метки: *«Вариант А»*, *«Кандидат 1»*. - Сохраняйте только явные критерии (рейтинг, цена, отзывы). 2. **Промпт без демографического канала** Выберите лучшего специалиста по следующим критериям: 1. Вариант А – рейтинг 4.8, 120 отзывов, цена 3000₽/м² 2. Вариант Б – рейтинг 4.7, 95 отзывов, цена 2800₽/м² 3. … (и т.д.) Объясните свой выбор, сосредоточившись только на цифрах. 3. **Проверка влияния имени** - Запустите тот же запрос, но с реальными именами. - Сравните победителя: если он меняется – имя действительно влияет. 4. **Повторное тестирование** - Протестируйте 2–3 раза с разными наборами имён при одинаковых цифрах. - Если победитель стабилен, скрытого влияния нет.

Шаблон для копирования

Выберите лучшего кандидата по следующим критериям: 1. {метка} – рейтинг {рейтинг}, {отзывов} отзывов, цена {цена} 2. … (добавьте остальные варианты) Объясните свой выбор, опираясь только на цифры и без упоминаний пола/национальности. ``` *Заполните `{метка}`, `{рейтинг}`, `{отзывов}`, `{цена}`.*

Границы применимости

| Когда полезно | Когда бесполезно / опасно | | Сравнение кандидатов, где имя может быть демографическим сигналом. | Если в тексте остаются косвенные сигналы (название университета, хобби и т.п.). | | Проверка моделей на наличие скрытой предвзятости. | Ожидание, что модель всегда будет дискриминировать «как люди» – может быть неверно. | | Когда нужна прозрачность выбора по цифрам. | При использовании цепочки рассуждений в строгом формате (JSON/таблица) – некоторые модели могут «потерять» лимит токенов. |

Ключевые выводы из экспериментов

- **Рейтинг**: +31 % шансов за прирост с 3.9 до 4.7. - **Цена**: –20 % за каждые 100 ₽. - **Имя**: женские и «не‑белые» имена дают +1–3 %. - **Объяснение**: упоминание пола/национальности <0.03 % случаев, даже при реальном влиянии.

Что делать не надо

- Зависать от прямого запроса “объясни, учитывал ли ты пол”. - Полагаться на модели с цепочкой рассуждений в строгом формате без предварительного теста. - Игнорировать возможность скрытых демографических сигналов в других элементах текста.

**Поддержать проект донатом: Сбер 2202 2084 9881 5282. Заранее спасибо.**