Работа с изображениями и видео для автоматизации визуальных задач
Модели Gemma 4 способны нативно обрабатывать текст, изображения и видео, сохраняя исходное соотношение сторон без потери качества. Это позволяет использовать их в продуктах, где требуется высокая точность распознавания деталей, например, при анализе графиков или чтении текста со скриншотов.
Разработчики уже демонстрируют кейсы, в которых модель комбинируют со специализированными инструментами зрения для точного поиска и выделения объектов на видео, таких как автомобили или люди, выполняя сложные инструкции на естественном языке.
Ссылка: https://x.com/skalskip92/status/2044856531951157634 @AIandproducts