А вот наши ребята выложили Visual Language Action фреймворк Green-VLA (одноименно с названием робота). Он позволяет связать зрение, язык и действия как одно целое и связать едиными политиками управления. А еще он обеспечивает минимизацию адаптации в разные физические воплощения: как в робота целиком, так и в платформенные конфигурации или вообще — отдельную роборуку.

А еще, модель умеет понимать на каком этапе задачи она находится и когда она не уверена и не творит дичь, плюс аккуратно предсказывает движение и конфигурацию всех суставов сразу, а не каждого по отдельности (что увеличивает плавность и качество управления телом)

Короче, очень похожа на универсальную модель-оператор для робота. Еще раз респект ребятам ❤️

Проголосуйте за их работу на hugging face: https://huggingface.co/papers/2602.00919