Уязвимость в защите скрытых рассуждений Claude, GPT и Gemini

Исследователи обнаружили способ извлекать цепочки рассуждений нейросетей, которые компании обычно скрывают от пользователей. Зашифрованные блоки данных, передаваемые клиенту, оказались переносимыми: их можно внедрить в более дешевую и менее защищенную модель, которая просто прочитает их содержимое.

Это позволяет злоумышленникам красть внутреннюю логику работы моделей, извлекать персональные данные, пароли и API-ключи из публичных логов, а также обходить фильтры безопасности.

Ссылка: https://arxiv.org/abs/2608.09867 @AIandproducts