Маленькая модель может учиться у большой — без копирования её весов

Этот метод называется дистилляцией знаний. Компактную модель-ученика обучают воспроизводить выходы крупной модели-учителя. Причём учитель может передавать не только готовую метку, но и распределение вероятностей: например, «лиса — 70%, собака — 20%, кошка — 10%».

Обычная метка «лиса» скрыла бы важную подсказку: собаку учитель считает более похожим вариантом, чем кошку. Ученик перенимает такие связи и может сохранить часть полезного поведения при меньшем размере.

Это не волшебное сжатие: редкие навыки могут потеряться, поэтому ученика всё равно проверяют отдельно.

#искусственныйинтеллект #нейросети #дистилляция

Маленькая модель может учиться у большой — без копирования её весов
Этот метод называется дистилляцией знаний. Компактную модель-ученика обучают воспроизводить выходы крупной модели-учителя | Сетка — социальная сеть от hh.ru