SmallThinker: семейство эффективных больших языковых моделей
Недавно внимание привлекли модели SmallThinker – семейство больших языковых моделей (LLM), разработанных для эффективного локального развертывания. Их инновационность заключается в архитектуре «Смесь экспертов» (Mixture-of-Experts, MoE), где модель состоит из множества специализированных нейросетей-экспертов. Для каждой задачи активируется лишь небольшая их часть; так, SmallThinker-21B-A3B из 21 миллиарда параметров одновременно использует только 3 миллиарда. Это значительно снижает требования к памяти и вычислениям. Дополнительная экономия достигается за счет разреженности на уровне нейронов (более 60% простаивают) и гибридного механизма внимания NoPE-RoPE, который позволяет обрабатывать длинные тексты (до 32 тыс. токенов), не увеличивая нагрузку на память. Модель также способна предсказывать, какие эксперты понадобятся, и заранее подгружать их в быструю память.
В тестах производительности, таких как MMLU (оценка общих знаний) и HumanEval (оценка навыков программирования), SmallThinker-21B-A3B показывает результаты на уровне или даже лучше, чем более крупные конкуренты. При этом впечатляет их эффективность: версия на 4 млрд параметров способна работать на устройстве с 1 ГБ ОЗУ, а версия на 21 млрд – с 8 ГБ, демонстрируя скорость более 20 токенов в секунду на обычном процессоре.
SmallThinker представляет собой радикальный отход от традиционной практики «сжатия облачных моделей для конечных устройств». Хотя у этих моделей есть ограничения, включая меньший объем обучающих данных по сравнению с облачными гигантами, отсутствие дообучения с подкреплением на основе отзывов человека (RLHF) и ориентацию в основном на английский и китайский языки, они открывают путь к приватному, отзывчивому и мощному ИИ, доступному практически на любом устройстве. Это демократизирует передовые языковые технологии, делая их доступными для гораздо более широкого круга пользователей и сценариев использования.