Двенадцать статистически значимых человек
Знаете, коллеги, иногда мне хочется немного поупражняться в аналитической статистике, но искать учебный датасет лень. И тут вечером профессиональная лента сама приносит мне пост с результатами опроса... об обучении бизнес-анализу. Скриншоты самих вопросов прикладываю (не в порядке их следования).
Участников оказалось немного, но автор успокаивает нас: "при определенных условиях полученную выборку можно назвать статистически значимой". Минимальное количество ответивших он оценивает в 12 человек и предполагает, что на разные вопросы отвечали преимущественно одни и те же люди.
На этом месте мне стало интересно уже само проведенное автором исследование.
Статистическая значимость не возникает у выборки просто потому, что в ней набралось какое-то количество человек. Нужно понимать, относительно какой генеральной совокупности мы делаем вывод, как получили эту выборку, какую гипотезу проверяем и каким методом. Здесь есть серия опросов среди подписчиков Telegram-канала, в которых добровольно участвовали от 12 до 18 человек.
Причем мы не знаем даже того, что это были одни и те же люди. Автор, кстати, сам признает это ограничение, но решает "рискнуть" и предположить обратное. Telegram показывает нам агрегированные результаты отдельных опросов, поэтому связать ответы конкретных респондентов между вопросами нельзя.
Для "разведочного" исследования это не катастрофа. Двенадцать человек тоже могут дать полезные сигналы. Вопрос в том, какие.
Например, 12 из 13 участников отметили ориентированность курса на практику. Автор делает вывод: "Ориентированность на практику решает", а затем объясняет его тем, что все устали от "водянистых" курсов.
Но вопрос, как вы можете наблюдать на скриншоте, допускал множественный выбор. Практику можно было отметить вместе со стоимостью, расписанием и другими факторами. Значит, мы знаем только то, что 12 человек учитывают практическую направленность при выборе курса. Является ли она решающей, неизвестно. А усталость от "водянистых курсов" опрос вообще не проверял. Наблюдение превратилось в вывод, а затем получило объяснение, которого в данных нет.
Похожая история с ценой. Двенадцати участникам предложили представить курс, который соответствует их требованиям и пожеланиям. Четверо выбрали 5–10 тысяч рублей, четверо - 10–25 тысяч, трое - 25–50 тысяч и один человек - больше 50 тысяч.
Автор "исследования" (простите, но в кавычках) видит здесь треть с минимальными суммами и другую треть с максимальными, а затем говорит нам о потенциальной ценности курса и высокой оценке труда его автора. Но максимальный диапазон выбрал один человек. "Другую треть" можно получить, только объединив две верхние категории. С тем же успехом можно объединить две нижние и сообщить, что две трети участников не выбрали цену выше 25 тысяч. Данные те же, меняется только история, которую мы хотим ими рассказать.
К тому же готовность выбрать цену воображаемого курса, полностью соответствующего пожеланиям, и готовность действительно заплатить эти деньги за конкретный продукт - не одно и то же. Но это маленькое лирическое отступление.
В итоге из опросов действительно можно получить несколько гипотез: практическая направленность, вероятно, важна части аудитории; цена имеет значение; некоторый интерес к обучению существует. Для небольшого "разведочного" исследования этого достаточно. Дальше можно выяснять, к примеру, каких компетенций людям не хватает, с какими задачами они испытывают сложности, почему существующие программы их не устраивают и какого результата они ждут.
То есть заняться тем самым выявлением потребностей, о котором пишет автор.
И вот здесь, пожалуй, проходит граница между просто опросом и исследованием. Собрать ответы недостаточно. Нужно еще понимать, что именно измерил каждый вопрос, какие выводы позволяют сделать полученные результаты и где заканчиваются данные и начинаются наши собственные предположения.
Данные действительно дают пищу для размышлений. Но между “у меня есть двенадцать ответов” и статистически обоснованным выводом все-таки должен находиться... анализ?