4 бита — не оценка ума модели 🧮

В названиях локальных моделей часто встречаются Q4, Q6 или Q8. Это варианты квантизации: числовые параметры модели хранятся с разной точностью. Чем меньше битов, тем меньше памяти требуется файлу и тем быстрее он может работать на подходящем устройстве. Но слишком сильное сжатие иногда ухудшает ответы — особенно в сложных рассуждениях, коде и редких языках.

Поэтому выбирать «самую маленькую» сборку только ради экономии не стоит. Возьмите два варианта одной модели, задайте им одинаковые типичные для вас задачи и сравните результат. Квантизация — это не новая модель, а выбор между компактностью и сохранением точности.

#ИИ #локальныйИИ #квантизация

4 бита — не оценка ума модели 🧮
В названиях локальных моделей часто встречаются Q4, Q6 или Q8. Это варианты квантизации: числовые параметры модели хранятся с разной точностью | Сетка — социальная сеть от hh.ru