Новости за последний час

Anthropic показала любопытную вещь: даже когда Claude просят не думать о мосте Золотые Ворота, внутри модели всё равно всплывают связанные токены вроде bridge и даже DAMN. То есть запрет на мысль не стирает её из внутренних активаций — модель всё равно тащит контекст в скрытое пространство.

А вот для тех, кто строит интерпретируемость, это хороший сигнал: смотреть только на ответы недостаточно, нужно разбирать, что именно живёт внутри сети. Вторая новость из этой пары — FORS, training-free метод высокоточного семплирования для диффузионных моделей. Он работает без дообучения, опирается только на оценки градиента первого порядка и получил Outstanding Paper на ICML 2026.

Источники: gonzo-обзоры ML статей, AI Post, Data Science by ODS.ai

Все новости: ai.popovs.tech

#MachineLearning #AI #исследования


В этом посте были ссылки, но мы их удалили по правилам Сетки