Зачем бигтехи выкладывают в открытый доступ свои датасеты? Вот, что стало достоянием общественности за последнее время:
⁃ VK выложили VK-LSVD (Large Short-Video Dataset) — большой обезличенный набор 40 млрд взаимодействий 10 млн пользователей с 20 млн коротких видео за январь–июнь 2025, есть эмбеддинги роликов и соцдем-признаки пользователей.
⁃ Яндекс выложили Yambda (YAndex Music Billion-interactions DAtaset) — музыкальный датасет с полной версией на 5 млрд записей и двумя урезанными на 500 млн и 50 млн.
⁃ Spotify выложили Million Playlist Dataset — набор пользовательских плейлистов для задач рекомендаций и поиска музыки.
⁃ Google выложили YouTube-8M — крупный датасет для исследований в области понимания видео и обучения моделей.
⁃ Kuaishou выложили KuaiRec — датасет для рекомендательных систем с событиями из реального сервиса.
Это альтруизм? Нет, у них на это пять причин:
1. Ускорить исследования и задать бенчмарки. Открытые наборы формируют стандарты индустрии и становятся бенчмарками для университетов и бизнеса, конкурсы и соревнования вокруг датасетов повышают общий уровень экосистемы рекомендательных моделей.
2. Свести академию с практикой. В отрасли не хватает современных открытых данных, из-за этого исследования часто расходятся с бизнес-реальностью; публикация крупных датасетов сокращает разрыв и ускоряет прикладные результаты.
3. Дать моделям масштаб и контекст реального мира. Небольшие или устаревшие выборки валидируются красиво, но ломаются в проде; большие датасеты с контекстом (устройство, гео, тип взаимодействия) улучшают обобщение и точность.
4. Отработать алгоритмы на доменах с плотными сигналами. Например, короткие видео дают непрерывный поток явных и неявных реакций; открытый набор позволяет тестировать рекомендации ближе к реальному поведению пользователей.
5. Похвастаться, но сохранить монетизацию. Бигтехи делятся обезличенными и усеченными данными, а ключевые профили и реакции держат закрытыми как основной коммерческий актив.
Вы же не надеялись, что с вами поделятся куском пирога?