Запускать гигантские нейросети теперь можно на домашнем ПК

Новый ИИ-движок FreeToken оптимизировали под модели с архитектурой MoE. Он распределяет нагрузку между видеокартой, оперативной памятью и процессором, позволяя запускать крупные модели даже на обычном железе.

Заявленная производительность:

Qwen3.6 35B — 39 токенов/с на RTX 4060 8 ГБ; DeepSeek-V4-Flash 284B — 22–25 токенов/с на RTX 5090.

https://github.com/FlashML-org/FreeToken