Как запустить локальную LLM?

Я уже давно все пытаюсь сделать себе личного Джарвиса. И пробовал разные варианты: OpenClow, Claude в тг, самописная история и тд. Делаю просто по фану, когда есть на это время. Ну и слежу за результатами других вайбкодеров.

Мой главный минус - нет свободного мака, чтобы крутить это 24 на 7. А делать через vps, опять деньги. Да и в целом, вся эта история постоянно просит денег за какие-то базовые действия. А подпиской Claude Code не хочется рисковать.

И вот тут пришла идея, а че бы не поставить на свой ПК с 8гб видюхи и 32гб оперативы свою LLM. Не прям много, но qwen3.5 : 9b в целом пойдёт. Кто не знает, через Llama можно поставить.

Попросил Codex, и все развернул за 30 минут. И то, дольше качалось. Все общение в тг пока. Сделали оркестратор и после этого еще за 30 минут поставил s2t и t2s. К сожалению русской норм озвучки нет, взял Silero TTS. Чучуть подтюнил (нормализация в помощь). И вуаля общаемся с ним через тг и все бесплатно. Свой транскрипт, озвучка, базовый поиск.

Потом еще вечер пытался улучшить голос и сделать свою TTS. Пока получилось на уровне Silero, и я далек до elevenlabs. Но интересно, до какого уровня можно дойти.

В целом, он пока слаб, скажем так, уровень " gpt начала 2025 с пиратской озвучкой". Попробую к нему прикрутить почту, календарь, более умный поиск и все остальное. Говорят, что если есть 16gb видюхи, то с qwen можно даже кодить.

Опять же удивляюсь тому в каком времени мы живём, что за пару вечеров можно сделать такое. Раньше бы это стоило куда больше времени.