Честно скажу: я не фанат локальных моделей. Пробовал, гонял на ноутбуке, для моих задач вышло неудобно.

Главные причины, по которым я вернулся в облако:

  • Локальная 8B-модель – это примерно 1% от размера облачного флагмана. На управленческих задачах разрыв с GPT-5 и Claude Sonnet виден сразу: там, где флагман разделяет симптомы и корневую причину, локальная 8B выдаёт общие рекомендации и принимает все факторы как равные.
  • На обычном ноутбуке без видеокарты – 3–8 токенов в секунду. Это одно-два слова каждые две секунды. Итеративный диалог превращается в замедленную съёмку.
  • Reasoning-режим локально – отдельная история. Модель может «думать» 5–10 минут, прежде чем начать печатать ответ. В облаке то же самое за 10–30 секунд.
  • Чтобы подобраться к уровню GPT-5 Mini, нужно железо от 150–200 тысяч рублей – Mac Studio с 64 ГБ или рабочая станция с парой видеокарт.

Но это не значит, что локальный запуск бесполезен. Если вы строите решение, где данные не должны покидать компьютер – конфиденциальные документы, работа без интернета, анализ клиентских переписок – это ваш сценарий. И порог входа тут ниже, чем кажется: Mac с M3/M4 и 16 ГБ или б/у RTX 3060 на 12 ГБ за 15–20 тысяч рублей уже дают нормальную скорость на Gemma 4 26B или Qwen 3.5 9B.

Забавно, что эта статья за последние дни пригодилась мне несколько раз – чтобы объяснить в чатах, кому локальные модели реально нужны, а кому проще остаться в облаке.

Полный гид с железом, моделями (DeepSeek V3.2, Qwen 3.6, Gemma 4), инструментами (Ollama, LM Studio, Jan) и агентным режимом: Локальные LLM для менеджера: что реально запустить дома