Исследование Стенфорда: мультимодальные модели могут имитировать зрение без анализа изображений

Ученые выяснили, что современные модели вроде Claude и GPT сохраняют до 80% точности в тестах, даже если полностью убрать изображение из запроса. Оказалось, что ИИ часто находит текстовые подсказки в самих вопросах и конструирует логический ответ на основе закономерностей в тексте, а не реального анализа картинки.

Это явление назвали миражным мышлением. Продуктовым командам стоит учитывать это при внедрении визуальных функций, так как модель может выдавать уверенные ответы, на самом деле не «видя» объект.

Ссылка: https://arxiv.org/abs/2603.21687 @AIandproducts