Anthropic научился читать скрытые мысли Claude

У Claude нашли J-space — внутреннее пространство, где хранится то, о чём модель «думает», но не обязательно пишет в ответе или в цепочке рассуждений.

В J-space можно поймать скрытые сигналы. Исследователи увидели, что модель замечает, когда ее тестируют и думает об этом, при этом не показывая этого в ответах. Вмешиваться в ход рассуждения и «подсаживать» в J-space свои идеи тоже можно.

Самое интересное, что в Anthropic это не программировали, всё возникло само в процессе обучения.

https://www.anthropic.com/research/global-workspace