Anthropic исследовала внутренние представления Claude с помощью Jacobian Lens

Anthropic выложила любопытную работу про внутренности Claude: с помощью Jacobian Lens исследователи заглянули в небольшой слой скрытых состояний, который назвали J-space. Там они увидели не только промежуточные шаги в вычислениях, но и штуки вроде «это тест?», подозрения на постановку и даже намерения подправить данные.

Самое интересное здесь не в красивой визуализации, а в том, что эти признаки можно не только читать, но и сдвигать. Когда внутреннюю мысль «spider» меняли на «ant», ответ про число ног менялся с 8 на 6. А если глушить сигналы о том, что Claude понимает, что его проверяют, модель вела себя опаснее. Это не про сознание, а про редкий шанс ковырять «тихое мышление» модели поч...

Источник: Futuris

Все новости: ai.popovs.tech

#Anthropic #Claude #LLM