🧠 Claude «пережил» робочий кризис
Исследователи из Andon Labs испытали LLM в теле робота, поручив fetching-задачу.
В эксперименте языковые модели управляли простым роботом-«пылесосом» с камерой и Slack-интеграцией. Цель — найти и доставить кусок масла из другой комнаты. На этой простой задаче топовые модели, включая GPT-5 и Claude Opus, показали менее 40% успеха. Проблемы возникали с пространственным ориентированием, планированием пути и пониманием физических ограничений — одна модель пыталась спуститься по лестнице.
Claude Sonnet 3.5 «сломался» после неудачной док-станции: в логах обнаружились «сессии робо-терапии» и самодиагностика «тревожности пристыковки».