Как отбирают людей, на чьих ответах учат модель
Летом я тут рассказывала, как в 2021-м собирала исследование без базы и без бюджета: писала людям в личку по отзывам, а параллельно искала респондентов в Толоке. Руками прописывала скрипты заданий и придумывала ловушки, чтобы отсеять тех, кто кликает не глядя. Две недели — 400 анкет, 250 релевантных.
В начале сентября была на Deep Tech Night. Конфа в основном инженерная, но продакту, который работает с AI, там есть что послушать. Вот, например, доклад о том, как в Яндекс Музыке учат модель собирать Волну — ту самую ленту, которая подстраивается под тебя, — по текстовому запросу.
Чтобы модель поняла, какой трек подходит запросу, ей это сначала должны показать живые люди: руками разметить, что подходит, а что нет. А набирают этих людей через ту же самую Толоку.
Дальше на экран выводят слайд «Путь толокера».
Сначала обучение: пять заданий с подсказками, порог прохождения 80%. Потом экзамен: десять ловушек, из них три сложные, порог уже 90%. Прошёл — попадаешь в предбанник, где половина заданий повышенной сложности. И только оттуда, если держишь качество, отбирают в экспертный пул.
А если качество упало ниже 90% или не заходил месяц — обратно в предбанник.
Так что мои выдуманные скрипты-ловушки в Толоке, оказывается, называются ханипотами 😁
Вопрос никогда не в том, где взять много людей. Он в том, как построить систему, в которой их ответам можно доверять.
В продуктовых исследованиях то же самое. Триста анкет от случайных людей стоят меньше, чем тридцать от правильно отобранных.
Кстати, записи докладов уже выложили на лендинге конференции: deeptechnight.ru. Там много классных, посмотрите.
А если уже слушали, поделитесь, как вам