Mirage: Мультимодальные рассуждения в VLM
Mirage: Мультимодальные рассуждения в VLM без рендеринга изображений
Краткое содержание:
Исследователи из Массачусетского университета в Амхерсте и MIT представили Mirage — фреймворк, который позволяет мультимодальным моделям (VLM) выполнять задачи, требующие визуального мышления, без необходимости генерировать полноценные изображения. Вдохновленный человеческой способностью к мысленным образам, Mirage встраивает в процесс рассуждения компактные визуальные подсказки, что повышает производительность и точность моделей в решении сложных мультимодальных задач.
Этот подход решает проблему, при которой VLM, несмотря на способность обрабатывать текст и изображения, для рассуждений полагаются в основном на текст, что ограничивает их в задачах вроде пространственных головоломок. Mirage позволяет моделям 'думать' визуально, подобно человеку, избегая при этом вычислительно затратного рендеринга изображений и деградации способности к рассуждению, которая часто сопровождает обучение генерации картинок.
Подробности:
Mirage — это новый подход, позволяющий встраивать визуальное мышление непосредственно в текстовые рассуждения мультимодальных моделей (VLM — VisionLanguage Models, модели, работающие одновременно с текстом и изображениями). Вместо генерации целых изображений, модель оперирует 'латентными токенами' — компактными внутренними представлениями визуальных признаков, извлеченными из её скрытых состояний. Этот процесс имитирует человеческое 'мысленное воображение'.
Обучение модели проходит в два этапа. Сначала модель обучается с использованием как текстовых, так и визуальных данных (вспомогательных изображений) для привязки латентных токенов к реальным визуальным характеристикам. Затем этот контроль ослабляется, и модель учится генерировать и использовать эти токены для рассуждений, получая только текстовые инструкции. Финальный этап включает обучение с подкреплением (Reinforcement Learning), где модель поощряется за точность и правильное форматирование ответов.
Эффективность Mirage была протестирована на четырех задачах пространственного мышления, включая визуальные головоломки и геометрические задачи, с использованием небольшого набора из 1000 обучающих примеров. Результаты показали, что Mirage превосходит как текстовые, так и стандартные мультимодальные модели, особенно в задачах, требующих планирования, например, при решении лабиринтов. Даже уменьшенная версия модели показала высокие результаты, что говорит о надежности метода.
Влияние:
Согласно статье, основной эффект Mirage заключается в значительном улучшении производительности VLM в сложных мультимодальных задачах. Позволяя моделям рассуждать с помощью внутренних визуальных подсказок, а не только текста, фреймворк делает их 'более похожими на людей'. Это повышает точность и эффективность решения задач, требующих визуального планирования, и устраняет необходимость в ресурсоемкой генерации изображений, которая может ослабить способность модели к логическому мышлению.
Затронутые технологии:
- VLM (VisionLanguage Models)
- Reinforcement Learning
- Latent Tokens
Для кого полезно:
- Исследователи ИИ
- Разработчики мультимодальных моделей
- AIстартапы