Большая модель может включаться не вся сразу

В архитектуре Mixture of Experts внутри модели есть множество блоков-«экспертов». Для каждого очередного токена небольшой маршрутизатор выбирает лишь несколько подходящих блоков, а остальные в этот момент не участвуют в вычислении. Поэтому модель может иметь большую общую ёмкость, не прогоняя каждый токен через все параметры.

Но есть две оговорки: все веса всё равно нужно где-то хранить, а «эксперт» не обязан отвечать за понятную тему вроде истории или математики. Это скорее внутренняя специализация, которую модель выучила сама. MoE — не совет цифровых профессоров, а экономный способ подключать нужную часть большой сети.

#нейросети #LLM #архитектураИИ

Большая модель может включаться не вся сразу
В архитектуре Mixture of Experts внутри модели есть множество блоков-«экспертов» | Сетка — социальная сеть от hh.ru