Короткий гад по https://huggingface.co (Скачивание любой модели на компьютер и использования его автономно, без интернета)

1. Производители и Семейства (Кто создал «мозг») Выбор бренда определяет характер модели:

  • Meta (Llama 3/3.1/3.5): «Золотой стандарт». Самая большая экосистема, поддержка любым софтом. Универсальна.
  • Mistral AI (Mistral, Mixtral): Лидеры в архитектуре MoE (Mixture of Experts). Это когда модель огромная (например, 47B), но при ответе активирует лишь часть параметров (12B), что делает её очень быстрой при высоком интеллекте.
  • Google (Gemma 2): Очень сильны в логике и суммаризации, имеют уникальную архитектуру «дистилляции» (знания больших моделей втиснуты в малые).
  • Microsoft (Phi-3/3.5): «Учебники — это всё, что вам нужно». Обучены на высококачественных синтетических данных. Модель размером всего 3.8B может быть умнее моделей 7B-10B.
  • Alibaba (Qwen 2/2.5/3.5): На данный момент — мировые лидеры в кодинге, математике и мультиязычности (лучшая поддержка русского языка среди зарубежных моделей).
  • DeepSeek: Китайский проект, славится экстремальной эффективностью и открытостью архитектуры.

2. Квантование (Quantization) — Подробно Это процесс перевода весов модели из формата FP16 (16 бит на параметр) в более компактные форматы (8, 6, 4, 2 бита).

  • Зачем это нужно: Модель 70B в оригинале весит ~140 ГБ и требует 2-3 топовых видеокарты A100. После квантования до 4 бит она весит ~40 ГБ и влезает в обычную RTX 3090/4090.

  • Потеря качества:

    • 8-bit: Потеря почти нулевая (0.5-1%).
    • 4-bit: Оптимальный выбор. Потеря 2-3%, практически незаметно в чате.
    • 2-bit: Модель начинает «бредить» (галлюцинировать), связность текста падает.
  • Основные форматы:

    • GGUF: Работает везде (CPU + RAM, GPU, Apple Silicon). Один файл.
    • EXL2: Только для GPU NVIDIA. Самый быстрый формат.
    • AWQ / GPTQ: Стандарты для серверного деплоя (VRAM).

3. Расшифровка букв в версиях (K, L, M, S) Эти буквы встречаются в названиях файлов (особенно в формате GGUF от автора TheBloke или Bartowski). В контексте квантования (например, Q4_K_M):

  • K (K-Quants): Означает, что используется современный метод «блочного» квантования. Веса разбиваются на группы, и важные группы сжимаются меньше, а второстепенные — сильнее.
  • S (Small): Максимальное сжатие. Самая маленькая модель, но заметная потеря качества.
  • M (Medium): Баланс. Рекомендуется для 90% случаев.
  • L (Large): Минимальное сжатие внутри данного бита. Самая умная в своей категории, но тяжелая.

В контексте размера модели (например, Phi-3-mini или Llama-3-Small):

  • XS / Tiny: < 3B параметров (для смартфонов).
  • Small / Mini: 3B–8B параметров (для домашних ПК с 8-12 ГБ VRAM).
  • Medium: 14B–34B параметров (для мощных ПК с 24 ГБ VRAM).
  • Large / Huge: 70B+ параметров (для серверов).

4. Параметры (B) — на что реально влияют Параметры (Billions) — это количество нейронных связей.

  • Глубина знаний: 8B модель знает «всего понемногу», 70B модель знает детали квантовой физики или нюансы редких языков программирования.
  • Логика (Reasoning): Чем больше параметров, тем лучше модель справляется с цепочками рассуждений («Если А=Б, а Б=В...»).
  • Пример:
    • 8B модель на вопрос «Кто победил в битве при Калке?» может ответить правильно, но перепутать даты.
    • 70B модель распишет состав войск, тактику сторон и политические последствия.

5. Редакции моделей (Тэги) При поиске на HF обязательно смотрите на суффиксы:

  • Base: «Чистая» модель. Она умеет только продолжать текст. Если написать «Как дела?», она ответит «У меня хорошо, а у тебя? — спросил Иван». Не подходит для чата.
  • Instruct / Chat: Обучена отвечать на вопросы пользователя. Именно их нужно качать для личного использования.
  • Refined / Fine-tuned: Дообученная версия. Например, Llama-3-Russian-Instruct — это база Llama 3, которую специально учили лучше говорить по-русски.
  • Abliterated: Модели, у которых программно удалены «фильтры цензуры» (они будут отвечать на любые, даже опасные или грубые вопросы).