Короткий гад по https://huggingface.co (Скачивание любой модели на компьютер и использования его автономно, без интернета)
1. Производители и Семейства (Кто создал «мозг») Выбор бренда определяет характер модели:
- Meta (Llama 3/3.1/3.5): «Золотой стандарт». Самая большая экосистема, поддержка любым софтом. Универсальна.
- Mistral AI (Mistral, Mixtral): Лидеры в архитектуре MoE (Mixture of Experts). Это когда модель огромная (например, 47B), но при ответе активирует лишь часть параметров (12B), что делает её очень быстрой при высоком интеллекте.
- Google (Gemma 2): Очень сильны в логике и суммаризации, имеют уникальную архитектуру «дистилляции» (знания больших моделей втиснуты в малые).
- Microsoft (Phi-3/3.5): «Учебники — это всё, что вам нужно». Обучены на высококачественных синтетических данных. Модель размером всего 3.8B может быть умнее моделей 7B-10B.
- Alibaba (Qwen 2/2.5/3.5): На данный момент — мировые лидеры в кодинге, математике и мультиязычности (лучшая поддержка русского языка среди зарубежных моделей).
- DeepSeek: Китайский проект, славится экстремальной эффективностью и открытостью архитектуры.
2. Квантование (Quantization) — Подробно Это процесс перевода весов модели из формата FP16 (16 бит на параметр) в более компактные форматы (8, 6, 4, 2 бита).
-
Зачем это нужно: Модель 70B в оригинале весит ~140 ГБ и требует 2-3 топовых видеокарты A100. После квантования до 4 бит она весит ~40 ГБ и влезает в обычную RTX 3090/4090.
-
Потеря качества:
-
- 8-bit: Потеря почти нулевая (0.5-1%).
-
- 4-bit: Оптимальный выбор. Потеря 2-3%, практически незаметно в чате.
-
- 2-bit: Модель начинает «бредить» (галлюцинировать), связность текста падает.
-
Основные форматы:
-
- GGUF: Работает везде (CPU + RAM, GPU, Apple Silicon). Один файл.
-
- EXL2: Только для GPU NVIDIA. Самый быстрый формат.
-
- AWQ / GPTQ: Стандарты для серверного деплоя (VRAM).
3. Расшифровка букв в версиях (K, L, M, S) Эти буквы встречаются в названиях файлов (особенно в формате GGUF от автора TheBloke или Bartowski). В контексте квантования (например, Q4_K_M):
- K (K-Quants): Означает, что используется современный метод «блочного» квантования. Веса разбиваются на группы, и важные группы сжимаются меньше, а второстепенные — сильнее.
- S (Small): Максимальное сжатие. Самая маленькая модель, но заметная потеря качества.
- M (Medium): Баланс. Рекомендуется для 90% случаев.
- L (Large): Минимальное сжатие внутри данного бита. Самая умная в своей категории, но тяжелая.
В контексте размера модели (например, Phi-3-mini или Llama-3-Small):
- XS / Tiny: < 3B параметров (для смартфонов).
- Small / Mini: 3B–8B параметров (для домашних ПК с 8-12 ГБ VRAM).
- Medium: 14B–34B параметров (для мощных ПК с 24 ГБ VRAM).
- Large / Huge: 70B+ параметров (для серверов).
4. Параметры (B) — на что реально влияют Параметры (Billions) — это количество нейронных связей.
- Глубина знаний: 8B модель знает «всего понемногу», 70B модель знает детали квантовой физики или нюансы редких языков программирования.
- Логика (Reasoning): Чем больше параметров, тем лучше модель справляется с цепочками рассуждений («Если А=Б, а Б=В...»).
- Пример:
-
- 8B модель на вопрос «Кто победил в битве при Калке?» может ответить правильно, но перепутать даты.
-
- 70B модель распишет состав войск, тактику сторон и политические последствия.
5. Редакции моделей (Тэги) При поиске на HF обязательно смотрите на суффиксы:
- Base: «Чистая» модель. Она умеет только продолжать текст. Если написать «Как дела?», она ответит «У меня хорошо, а у тебя? — спросил Иван». Не подходит для чата.
- Instruct / Chat: Обучена отвечать на вопросы пользователя. Именно их нужно качать для личного использования.
- Refined / Fine-tuned: Дообученная версия. Например, Llama-3-Russian-Instruct — это база Llama 3, которую специально учили лучше говорить по-русски.
- Abliterated: Модели, у которых программно удалены «фильтры цензуры» (они будут отвечать на любые, даже опасные или грубые вопросы).