Единая модель Google для поиска по тексту, аудио и видео

Новая модель Gemini Embedding 2 от Google DeepMind позволяет объединить поиск по разным типам контента в одной системе. Обычно для работы с текстом, изображениями и видео требуются разные инструменты, но эта разработка переводит любой формат данных в единый цифровой вид.

Это дает возможность создавать более качественные рекомендательные системы и умный поиск: например, пользователь может найти видеоролик, загрузив картинку, или получить ответ от AI-ассистента на основе анализа медиафайлов. Технология уже доступна для использования в продуктах через API.

Ссылка: https://arxiv.org/abs/2605.27295 @AIandproducts