Про "синтетических респондентов"
Как я уже писал в предыдущих постах, ИИ вовсю вошёл в разные сферы нашей жизни — особенно в работу. Тема применения ИИ в исследованиях — отдельная широкая область, про которую я постараюсь писать интересно и с пользой.
Сейчас ИИ используется в исследованиях в самых разных ипостасях. Изначально, года 2–3 назад, я думал, что он может помочь только с анализом данных (саммари интервью, кодировка открытых вопросов, помощь с вычислениями через Python и т.д.), ну и с поиском информации, например, в рамках кабинетного исследования (о котором я уже писал ранее).
Однако сегодня ИИ не только помогает с такими, казалось бы, уже обыденными вещами, но и заставляет переосмысливать сами социологические методы и принципы. Одно из таких новых веяний — «синтетический респондент». Это некая модель среднестатистического представителя целевой аудитории, которая строится на большом массиве данных о ней. Такие модели призваны отражать поведенческие особенности, демографические характеристики, мнения и ценности аудитории, на основе данных которой этот «искусственный» респондент был создан.
Казалось бы, круто! Тебе не нужно покупать панель для опроса или рекрутировать людей на интервью — собрал такого «синтетика» на основе данных по ЦА, пообщался с ним или провёл опрос на «синтетической» популяции — и вот тебе готовый массив данных для анализа.
Но всегда есть «НО»: 1) Данные для обучения нужно где-то взять. Это могут быть данные переписи, CRM, агрегированные данные из пользовательских каналов, базы Big Data-провайдеров (Сбер, МТС, Яндекс и др.). Но собрать их — задача нетривиальная, а порой и дорогая. Даже если покупать готовые данные, это удовольствие не из дешёвых. А общедоступные источники вроде переписи часто бывают неполными для задач конкретного исследования. 2) "Данные всегда устаревшие". Мы принимаем решения на основе информации, собранной когда-то, то есть с временным лагом. А «чёрные лебеди» и новые тренды могут кардинально изменить картину мира, что, естественно, не отразится на синтетических респондентах — точнее, на данных, на которых они основаны. 3) Сложность с редкими ЦА. Вам будет крайне трудно создать искусственную популяцию для узкой аудитории, например, «шестидесятилетних любителей хомячков из Бирюлёво». Чтобы построить модель, нужно достаточно данных, которых по такой специфической группе скорее всего не окажется. В лучшем случае модель просто не получится, в худшем — будет переполнена бесполезным шумом.
Это основные, но далеко не все ограничения такого инструмента. В сети можно найти примеры успешного применения «синтетики» — например, СберМаркетинг делал что-то подобное в крупных проектах. С другой стороны, как говорят мне эксперты из одного из крупнейших исследовательских центров, у них, например, такой опыт закончился ничем...
Конечно, общение социолога с машиной заставляет по-новому взглянуть на профессию. Но не менее интересно, когда респондент общается с машиной) И такие примеры уже есть. У нас в компании уже есть кейсы (в том числе где я выступал как проджект), когда мы проводим мини-интервью с большим количеством сотрудников с помощью ИИ-бота. Респондент может общаться с ботом письменно — через чат, или с помощью голосовых сообщений. Так мы собираем большой массив качественной информации: кейсы, примеры из практики, переживания и мнения сотрудников. Всё это потом анализируется через контент-анализ, выявляются ключевые барьеры и драйверы для внедрения изменений, и даже оценивается влияние на бизнес-показатели.
Но об этом — в другой раз)