Российские исследователи научили языковые модели понимать сложные трехмерные сцены

Команда Института AIRI и Центра когнитивного моделирования МФТИ представила 3DGraphLLM — метод, который расширяет возможности больших языковых моделей при работе с трехмерным пространством.

В отличие от прежних решений, 3DGraphLLM позволяет учитывать пространственные и семантические связи между элементами сцены — от расположения до относительных размеров и контекста использования. Это особенно важно при анализе насыщенных бытовых пространств, таких как кухня, мастерская или офисное помещение, где десятки объектов тесно связаны друг с другом.

Модель обучалась на данных из наиболее известных и больших датасетов ScanNet, 3RScan, которые содержат точные реконструкции реальных помещений, и расширенных датасетов вроде ScanRefer и Multi3DRefer, содержащих текстовые запросы к реконструированным сценам. В качестве языковых моделей использовались Vicuna-v1.5 и LLAMA3 соответственно с 7 и 8 миллиардами параметров — относительно компактные, чтобы запускаться на энергоэффективных компьютерах с графическим процессорами (например, Nvidia Jetson AGX Orin), которые обычно встраиваются в робототехнические платформы.

💬 Подробности

#AIRI #LLM

💬 Участвуйте в новом розыгрыше 💬 Читайте нас в: | Telegram | VK | Сайт |


В этом посте были ссылки, но мы их удалили по правилам Сетки

⏺ Российские исследователи научили языковые модели понимать сложные трехмерные сцены
Команда Института AIRI и Центра когнитивного моделирования МФТИ представила 3DGraphLLM — метод, который расширяет в... | Сетка — социальная сеть от hh.ru