4 бита — не оценка ума модели 🧮
В названиях локальных моделей часто встречаются Q4, Q6 или Q8. Это варианты квантизации: числовые параметры модели хранятся с разной точностью. Чем меньше битов, тем меньше памяти требуется файлу и тем быстрее он может работать на подходящем устройстве. Но слишком сильное сжатие иногда ухудшает ответы — особенно в сложных рассуждениях, коде и редких языках.
Поэтому выбирать «самую маленькую» сборку только ради экономии не стоит. Возьмите два варианта одной модели, задайте им одинаковые типичные для вас задачи и сравните результат. Квантизация — это не новая модель, а выбор между компактностью и сохранением точности.