⏺ Ученые T-Bank AI Research разработали метод SAE Match, показывающий, как работают механизмы принятия решений у ИИ и почему модель делает то или иное заключение
Современные LLM-модели состоят из нескольких слоев, каждый из которых использует результат предыдущего. Так модель старается улучшить свои предсказания слой за слоем. Однако иногда модель может выдавать недостоверную или даже оскорбительную информацию.
Ранее не существовало метода, который позволял бы проследить, как концепции изменяются от слоя к слою. SAE Match стал первым инструментом, который не просто фиксирует концепции на отдельных слоях, а анализирует их эволюцию в процессе вычислений. Эксперименты на ряде моделей показали, что он помогает отслеживать признаки, которые остаются неизменными на нескольких слоях сети. Это делает поведение ИИ более предсказуемым и понятным.
Результаты исследования будут представлены на международной конференции по обучению представлений (ICRL), которая пройдет в Сингапуре с 24 по 28 апреля 2025.
💬 Подробности в релизе.
@divannyi_it подписаться