Новости за последний час
Исследователи предложили фреймворк, который пытается измерять, сколько памяти у трансформера уходит не на обобщение, а на запоминание. На сотнях GPT-подобных моделей они получили оценку около 3,6 бита на параметр — цифра выглядит полезной, хотя к таким аккуратным числам в ML всегда стоит относиться с проверкой по независимым репликам.
Авторы также связывают свою схему с double descent и утверждают, что при очень большом объёме данных относительно параметров обучение уходит от риска утечек. Самое смелое место — вывод про membership inference: при соотношении токенов к параметрам выше 100 атаки, по их расчёту, почти сходят к случайному угадыванию. Это звучит привлекательно для тех, кто строит пайплайны с чувствительными данными, но именно тут захочется видеть, как это переживёт другие датасеты и модели.
Источники: gonzo-обзоры ML статей, Habr AI, Habr AI
Все новости: ai.popovs.tech
В этом посте были ссылки, но мы их удалили по правилам Сетки