Демографическая симуляция аудитории как «soft‑voting» LLM

Что это за метод?

LLM, обученные на миллионах текстов, запоминают статистические связи между **социальным профилем** (пол, возраст, регион, доход, образование и отношение к теме) и **взглядами/поведением**. Если попросить модель дать *распределение вероятностей* по всем вариантам ответа для конкретного “синтетического человека”, а затем усреднить эти распределения по десяткам‑сотням таких персон, получаем надёжный прогноз поведения **группы**, а не отдельного индивида.

Как это работает?

1. **Определяем персону** – короткое описание профиля (пол, возраст, регион, доход, образование, отношение к теме). 2. **Запрашиваем распределение вероятностей** по всем вариантам ответа (не один выбор). 3. **Повторяем** шаг 2 для множества разных персон (10–200), без сохранения памяти о предыдущих запросах. 4. **Умножаем** вероятность «участия» (например, “придёт ли голосовать”) на каждую из вероятностей вариантов и **суммируем/нормализуем** по всем персонам → итоговый прогноз группы.

Пример применения – маркетолог мобильного оператора

| Персона | Пол | Возраст | Регион | Доход (руб.) | Образование | Отношение к интернету | | 1 | Женщина | 34 | Краснодар | 60‑80k | Высшее | Среднее | | … | … | … | … | … | … | … | **Промпт (один запрос):** ``` Ты — участник опроса. Вот твой профиль: Женщина, 34 года, Краснодар, доход 60‑80 тыс., высшее образование, среднее отношение к интернету. Вопрос: новый тариф без минут разговора, стоимость 450 руб/мес. Оцени в процентах вероятность каждого действия: - Подключу сразу: __% - Рассмотрю, но не сразу: __% - Не подключу: __% Сумма = 100%. Верни только числа. ``` **Повторяем** для 20‑30 разных персон. **Агрегация (отдельный запрос):** ``` Вот ответы 25 персон на вопрос про тариф: [список чисел] Посчитай средневзвешенный процент по каждому варианту и укажи, какие сегменты дают наиболее отличающиеся ответы. ``` Получаем таблицу: - Подключат сразу – 42 % - Рассмотрят – 35 % - Не подключат – 23 %

Шаблон промпта

Ты — участник опроса. Вот твой профиль: {пол, возраст, регион, доход, образование, отношение к теме} Вопрос: {твой вопрос о продукте/решении} Оцени в процентах вероятность каждого варианта: - {вариант 1}: __% - {вариант 2}: __% - {вариант 3}: __% Сумма должна быть 100%. Верни только цифры. ``` Вот ответы {N} персон на вопрос про {тема}: {вставить все ответы} Посчитай средневзвешенный процент по каждому варианту и укажи, какие сегменты (по возрасту/доходу/региону) дают наиболее отличающиеся ответы. ```

Ключевые выводы из экспериментов

- **Точность**: при 50 персон LLM‑прогноз совпадает с реальными опросами в пределах ±5 %. - **Модели**: крупные модели (GPT‑4, Claude‑3) сохраняют неопределённость; малые модели склонны ставить нули/единицы и смещают прогноз. - **Шум**: шум одного синтетического человека исчезает после усреднения; остаётся системная закономерность.

Ограничения и риски

| Когда не работает | Почему | | Один человек | Шумный, неточный ответ | | Малые модели | Категоричные 0/100 % → потеря нюансов | | Слабо представленные группы | Стереотипы из обучающих данных искажают прогноз | | Языки/темы с низкой плотностью текстов | Менее точные связи демографии ↔ мнения |

Когда стоит использовать

- **Быстрый «первый взгляд»** на реакцию целевых сегментов без дорогих опросов. - **Сценарный анализ** (например, оценка реакции на новый тариф, политическое сообщение). - **Проверка гипотез** о влиянии демографии на предпочтения.

Что делать не надо

- Ожидать точного ответа для конкретного индивида. - Пытаться «вывести» единственный выбор – модель потеряет полезный шум. - Использовать дешёвые модели без проверки их склонности к 0/100 %.

**Номер исследования:** 2608.15871 Поддержать проект донатом: Сбер 2202 2084 9881 5282. Заранее спасибо.