Mirage: Мультимодальные рассуждения в VLM

Mirage: Мультимодальные рассуждения в VLM без рендеринга изображений

Читать статью

Краткое содержание:

Исследователи из Массачусетского университета в Амхерсте и MIT представили Mirage — фреймворк, который позволяет мультимодальным моделям (VLM) выполнять задачи, требующие визуального мышления, без необходимости генерировать полноценные изображения. Вдохновленный человеческой способностью к мысленным образам, Mirage встраивает в процесс рассуждения компактные визуальные подсказки, что повышает производительность и точность моделей в решении сложных мультимодальных задач.

Этот подход решает проблему, при которой VLM, несмотря на способность обрабатывать текст и изображения, для рассуждений полагаются в основном на текст, что ограничивает их в задачах вроде пространственных головоломок. Mirage позволяет моделям 'думать' визуально, подобно человеку, избегая при этом вычислительно затратного рендеринга изображений и деградации способности к рассуждению, которая часто сопровождает обучение генерации картинок.

Подробности:

Mirage — это новый подход, позволяющий встраивать визуальное мышление непосредственно в текстовые рассуждения мультимодальных моделей (VLM — VisionLanguage Models, модели, работающие одновременно с текстом и изображениями). Вместо генерации целых изображений, модель оперирует 'латентными токенами' — компактными внутренними представлениями визуальных признаков, извлеченными из её скрытых состояний. Этот процесс имитирует человеческое 'мысленное воображение'.

Обучение модели проходит в два этапа. Сначала модель обучается с использованием как текстовых, так и визуальных данных (вспомогательных изображений) для привязки латентных токенов к реальным визуальным характеристикам. Затем этот контроль ослабляется, и модель учится генерировать и использовать эти токены для рассуждений, получая только текстовые инструкции. Финальный этап включает обучение с подкреплением (Reinforcement Learning), где модель поощряется за точность и правильное форматирование ответов.

Эффективность Mirage была протестирована на четырех задачах пространственного мышления, включая визуальные головоломки и геометрические задачи, с использованием небольшого набора из 1000 обучающих примеров. Результаты показали, что Mirage превосходит как текстовые, так и стандартные мультимодальные модели, особенно в задачах, требующих планирования, например, при решении лабиринтов. Даже уменьшенная версия модели показала высокие результаты, что говорит о надежности метода.

Влияние:

Согласно статье, основной эффект Mirage заключается в значительном улучшении производительности VLM в сложных мультимодальных задачах. Позволяя моделям рассуждать с помощью внутренних визуальных подсказок, а не только текста, фреймворк делает их 'более похожими на людей'. Это повышает точность и эффективность решения задач, требующих визуального планирования, и устраняет необходимость в ресурсоемкой генерации изображений, которая может ослабить способность модели к логическому мышлению.

Затронутые технологии:

  • VLM (VisionLanguage Models)
  • Reinforcement Learning
  • Latent Tokens

Для кого полезно:

  • Исследователи ИИ
  • Разработчики мультимодальных моделей
  • AIстартапы
Mirage: Мультимодальные рассуждения в VLM | Сетка — социальная сеть от hh.ru