Маленькая модель может учиться у большой — без копирования её весов
Этот метод называется дистилляцией знаний. Компактную модель-ученика обучают воспроизводить выходы крупной модели-учителя. Причём учитель может передавать не только готовую метку, но и распределение вероятностей: например, «лиса — 70%, собака — 20%, кошка — 10%».
Обычная метка «лиса» скрыла бы важную подсказку: собаку учитель считает более похожим вариантом, чем кошку. Ученик перенимает такие связи и может сохранить часть полезного поведения при меньшем размере.
Это не волшебное сжатие: редкие навыки могут потеряться, поэтому ученика всё равно проверяют отдельно.