Не все параметры модели работают над каждым словом
У некоторых языковых моделей есть архитектура Mixture of Experts — «смесь экспертов». Внутри находятся несколько специализированных блоков, а небольшой роутер для каждого токена выбирает лишь часть из них. Поэтому разные фрагменты запроса могут проходить через разные участки модели.
Отсюда важная деталь на карточках таких систем: общее число параметров и число активных параметров — не одно и то же. Модель может хранить огромный запас весов, но при одном вычислении задействовать только его долю. Поэтому сравнивать MoE и обычную плотную модель лишь по самой крупной цифре некорректно: сначала уточните, какие параметры считаются — все или активные.