Горькая правда о том куда идет весь ML

Предыдущий пост мы закончили на том, что рекомендательные модели всё лучше используют смысл товаров и общий контекст. Давайте поразгоняем эту тему дальше.

В ML-кругах есть известная статья The Bitter Lesson Ричарда Саттона. Статья о том, что в алгоритмических продуктах со временем алгоритмы и вычисления побеждают ручные бизнес-правила, основанные на экспертном знании.

В пределе любую задачу, которая возникает на Земле, оптимальнее всего решать с помощью максимального количества сырых данных, мощных моделей и огромных вычислительных ресурсов. Будь то составление бюджета корпорации, игра в шахматы, диагностика заболеваний или написание нового бестселлера.

Пример 1. Автоматизация игры в ГО Ранние программы для го кодировали человеческие стратегии вручную. AlphaGo добавила обучение и масштабный поиск вариантов. AlphaGo Zero пошла дальше и отказалась от партий экспертов. Она обучалась только через игры против самой себя и не использовала никаких человеческих знаний об игре в го, накопленных столетиями. В итоге AlphaGo Zero победила прежнюю AlphaGo со счётом 100:0.

Пример 2. Рекомендательная система Facebook Классические модели рекомендаций использовали десятки тысяч вручную созданных признаков. Среди них были показатели кликабельности по тематикам, счётчики взаимодействий и различные соотношения. Также использовались агрегированные показатели и многочисленные категориальные признаки.

В HSTU подход изменился. Модель получает последовательность действий пользователя. Она видит показанный материал, действие пользователя и время события. Также модель получает сведения о пользователе и самом материале. На этих данных она сама изучает связи и закономерности. Например, отдельный показатель кликабельности по тематике больше не нужен. Модель может определить его по истории действий.

Пример 3. Компьютерное зрение в массы Долгое время системы компьютерного зрения строились вокруг вручную созданных признаков. Инженеры проектировали детекторы границ, углов, текстур и других визуальных паттернов. Затем эти признаки передавались в отдельные алгоритмы классификации. С появлением глубоких нейронных сетей подход изменился. Модель получает изображение целиком и сама учится извлекать полезные представления. На первых слоях она обнаруживает простые структуры, затем формы, части объектов и в итоге целые объекты. Признаки больше не проектируются вручную. Они возникают в процессе обучения как наиболее полезные для решения задачи. Хороший пример - задача найти по камерам на заводе человека, который зашёл в опасную зону. Десять лет назад для такой системы потребовалась бы большая команда, вручную проектирующая признаки и правила. Сегодня во многих случаях достаточно взять готовую архитектуру, дообучить её на своих данных и развернуть на нескольких GPU. Типичный проект, который раньше требовал около 15 человек, теперь могут сделать 2-3 инженера и несколько видеокарт.

—-

Очень вероятно что в пределе любая ML-задача на земле будет решаться через гору вычислительных мощностей, стандартные библиотеки и несколько человек на прикручивание этого всего к бизнесу.

Горькая правда о том куда идет весь ML
Предыдущий пост мы закончили на том, что рекомендательные модели всё лучше используют смысл товаров и общий контекст. Давайте поразгоняем эту тему дальше | Сетка — социальная сеть от hh.ru