Новости за последний час

Исследователи предложили фреймворк, который пытается измерять, сколько памяти у трансформера уходит не на обобщение, а на запоминание. На сотнях GPT-подобных моделей они получили оценку около 3,6 бита на параметр — цифра выглядит полезной, хотя к таким аккуратным числам в ML всегда стоит относиться с проверкой по независимым репликам.

Авторы также связывают свою схему с double descent и утверждают, что при очень большом объёме данных относительно параметров обучение уходит от риска утечек. Самое смелое место — вывод про membership inference: при соотношении токенов к параметрам выше 100 атаки, по их расчёту, почти сходят к случайному угадыванию. Это звучит привлекательно для тех, кто строит пайплайны с чувствительными данными, но именно тут захочется видеть, как это переживёт другие датасеты и модели.

Источники: gonzo-обзоры ML статей, Habr AI, Habr AI

Все новости: ai.popovs.tech

#LLM #AI #исследования


В этом посте были ссылки, но мы их удалили по правилам Сетки