VLA роботы и демография
В последнее время меня интересует тренд в робототехнике — архитектуры VLA (Vision-Language-Action). Этот подход объединяет восприятие, мышление и действие в единую модель, позволяя роботам адаптироваться к новым задачам, в том числе тем, которым они напрямую не обучались, обобщать знания и взаимодействовать с людьми естественным образом.
Например, по команде «забить гвоздь» при отсутствии молотка робот может самостоятельно найти подходящий предмет. Представьте себе ChatGPT, существующий не в виде собеседника в чате, а в форм-факторе робота-гуманоида, который способен воплощать в реальном мире все то, о чем вы ранее только переписывались с моделью.
Лично у меня уже возникает желание приобрести Jetson Orin Nano, шасси, камеру и множество сервоприводов для экспериментов.
И ещё волей-неволей вспоминаются апокалиптические прогнозы уважаемого господина Мараховского, который в одном из своих философских текстов опасался следующего:
«Когда на рынке появится более-менее доступный секс-робот, оснащённый, например, GPT-8.5, настолько продвинутым, что он способен поддерживать разговор на уровне «прелесть какой дурочки» (надо думать, это уже возможно), а также обладающий достаточным количеством сервомоторов, чтобы встать с постели и совершить два великих дела: принести пиво из холодильника и, забрав у роботокурьера пиццу, поместить её в микроволновку.»
Именно в этот момент, по его мнению, будет нанесён сокрушительный удар по традиционной семье и окончательно добита демография, уже находящаяся в удручающем состоянии.
Впрочем, не будем о грустном. Нож — инструмент, которым можно резать хлеб, а можно наносить раны. То же самое верно для большинства изобретений человечества, и, полагаю, в данном случае мы не увидим исключения.
Интересующихся же техническими аспектами отсылаю к превосходной статье разработчика из Яндекса: «Когда LLM — это не чат, а мозг: путь к VLA-архитектуре».