В LLM обнаружили отделимый от языка концепт, связанный с проверкой перед действием
В LLM нашли концепт, который не привязан к конкретному языку: не к английскому, не к коду, а к поведению «сначала проверь, потом действуй». Его выделили через activation steering в скрытых состояниях модели Qwen и получили отдельное векторное направление.
Потом это направление вернули в генерацию — и поведение модели заметно сдвигалось. Такие работы интересны не пресс-релизной магией, а тем, что чуть приоткрывают, как именно внутри модели живут абстрактные инструкции и можно ли ими управлять почти как ручками.
Источник: Habr AI
Все новости: ai.popovs.tech
В этом посте были ссылки, но мы их удалили по правилам Сетки