Эволюционируем в Media ML Data Engineer

Поскольку я работаю в медиа, то просто не могла пройти мимо статьи Netflix о том, что они выделили у себя новую специализацию для дата инженеров - Media ML Data Engineer. Эти ребята не просто строят витрины на “классических” структурированных данных, но также умеют работать с медиа-данными.

Что такое медиа-данные?

Это сложные мультимодальные данные: видео, звук, текст, изображения, а также и прозводная информация (э_мбеддингы, субтитры, транскрипты и т.д._).

Они неструктурированы, обладают огромным объемом и тесно интегрированы в креативные бизнес-процессы, что требует специального подхода к обработке и управлению.

Какие обязанности у Media ML DE?

По факту, эта роль находится на стыке классической инженерии данных, ML и контент-продакшена, поэтому перечень задач получается обширным:

▪️Создание и поддержка Media Data Lake - платформы для хранения и обработки медиа файлов и их метаданных. ▪️Стандартизация данных: обеспечение согласованности и качества медиаданных разных модальностей (видео, изображения, аудио, текст) для ML-задач. ▪️Управление метаданными: унификация и обогащение метаданных для отслеживания их происхождения, качества и покрытия. ▪️Подготовка данных для ML. ▪️Тесная работа с ML-исследователями, инженерами платформ и экспертами в области контента для создания практичных data-решений.

Глобально, цель этой роли - научиться анализировать медиа данные и построить мост между творческими процессами и ML-моделями.

Подробнее об архитектуре Media Data Lake в Netflix

В первую очередь, это не универсальный дата лейк, а платформа, предназначенная исключительно для медиа активов, использующая передовые решения для векторного хранения (пилотируется LanceDB).

✏️Отдельно стоит отметить Media Tables - это структурированные датасеты, которые являются ядром Media Data Lake. Это эволюция традиционных таблиц, но с ключевым отличием:

Они содержат не только стандартные метаданные (название, длительность, разрешение и т.д.), но и результаты работы ML-моделей (например, эмбеддинги, транскрипты, теги сцен), что делает их доступными для сложных запросов, например, векторного поиска.

Также из особенностей, Netflix реализуют двухуровневую систему доступа: ✔️Онлайн-система: для легковесных запросов и интерактивного исследования сырых медиаданных. ✔️Оффлайн-система: для масштабированной пакетной обработки (GPU/CPU), обучения ML-моделей и исследований.

Что я думаю?

Конечно, эта роль крайне узкоспециализированная и имеет смысл только в контексте построения медиа дата лейка, что само по себе очень сложная и ресурсоемкая задача. Пока точно нет смысла всем учиться работать с медиа-данными, но с развитием технологий структурирования неструктурированного (с помощью тех же трансформеров, к примеру) такая экспертиза будет все более востребованной.

Как думаете, скоро ли мы увидим вакансии Media ML Data Engineer на российском рынке 🧐?

©️что-то на инженерном

Эволюционируем в Media ML Data Engineer
Поскольку я работаю в медиа, то просто не могла пройти мимо статьи Netflix о том, что они выделили у себя новую специализацию для дата инженеров - Media ML Data... | Сетка — социальная сеть от hh.ru