Про датасеты и людей
Чтобы большие и сложные ML-модели работали качественно, им не обойтись без работы человека. Почитала немного про сервис Толока, каким он стал сейчас - вдохновило разобраться самой и рассказать тут, почему мы нужны ИИ намного больше, чем кажется.
Модели обучаются на датасетах - наборах специально подготовленных данных. Важно, что в датасетах данные не сырые - они уже стандартизированы, сэмплированы, очищены от выбросов и пропусков и категоризированы (= размечены) нужным образом.
Информация об объектах внутри датасетов "разложена по полочкам": каждый имеет свой набор признаков (= фич), а также связей с другими объектами и конкретное место в этом датасете. Чем больше признаков у объектов - тем сложнее обработка датасета (поэтому никогда не ругайтесь на аналитиков, если они говорят, что модель вторые сутки не считается - они не специально))
Датасеты могут быть в виде простых таблиц (в строке - объект, в колонке - признак), упорядоченных таблиц (где важно именно место расположения объекта), а также графов (где главное - связи между объектами).
К счастью, аналитикам и бизнесу не нужно каждый раз с нуля готовить набор данных для обучения модели. Есть довольно большое количество готовых датасетов, которые научат вашу модель строить финансовый прогноз, анализировать настроение пользователя или правильно распознавать музыку - если вдруг вам внезапно захочется сделать свой собственный Shazam. На Хабре есть классная статья со всеми ссылками - оставлю тут, вдруг пригодится.
Но если вдруг нужно собрать новый датасет, тут есть два пути:
1) 💻 автоматическое заполнение (когда заранее подготовленная таблица заполняется через системы сбора уже структурированными данными - через добычу информации с сайтов, сбор ответов людей при онлайн-анкетировании и т.д.). Есть еще так называемый синтетический датасет - когда ML-модели взаимодействуют друг с другом и записывают, к чему приводят те или иные действия.
2) 🤷♀️ заполнение вручную (когда данные сначала нужно структурировать). Этим как раз занимаются люди - сами отсматривают объекты и описывают их признаки.
Примеры задач для структурирования информации есть в Яндекс Заданиях - это аналог ушедшей с рынка РФ Толоки:
- определить тематику рекламных объявлений - указать, насколько продукт соответствует конкретному поисковому запросу - классифицировать объект на фотографии
Если что, за это иногда еще платят деньги.
Зачем это все нужно? Чтобы модели давали ответ как человек, а не как машина. Модели пытаются где-то автоматизировать и упростить человеческие суждения, где-то начинают основательно глючить, и чтобы даже просто показать правильный товар в рекомендациях, им требуется обучение на человеке. Из личного опыта борьбы с рекомендациями - Озон: пока там по запросу "красная футболка" выдается процентов 20 футболок, а остальное - либо футболки другого цвета, либо вообще вещи из других категорий. И если замечали, там при выдаче есть блок с вопросом "насколько товары соответствуют поиску" - если не соответствует, пользователю предлагается заполнить форму, а что конкретно не так. Вангую, что это все идет на дообучение моделей рекомендаций в Озоне 🤖
Каждая задача, которую решает сейчас AI, построена на данных, собранных и размеченных человеком. Алгоритм после обучения работает сам - но под капотом всегда лежат решения людей, которые размечали данные. Об этом важно помнить, чтобы не так сильно очаровываться искусственным интеллектом.
Ну, с кратким экскурсом закончили. А если вдруг захочется узнать про это все чуть больше - очень советую почитать / посмотреть недавнее интервью про Толоку в TheBell. Может, еще и на свой краудсорс-стартап вдохновит ⛵