Все-таки причина моих неудач с локальными агентами на моем железе - больше в моих руках, чем в недостатках нынешних технологий. Сейчас на Mac M1 Pro 32Gb уже можно крутить вполне мощные модельки и они довольно шустрые, если правильно настроить. Там довольно много тонкостей, и если просто написать клоду "засетапь мне квен на моем маке" - скорее всего, не сразу выйдет оптимально. Надо самому хоть что-то знать и задавать наводящие вопросы. Но в итоге получилось примерно так. Наиболее подходящие модели - Qwen 3.6 35B - A3b или Gemma 4 27B-A4b. Движок для инференса - oMLX либо llama.cpp. Версии моделей- 4бит квантизация от unsloth. KV cache без квантизации, контекст в 131к токенов. Для кодинга вполне можно nanocoder или oh my pi, последний - поприятнее. Сейчас играюсь с hermes, qwen в нем отвечает вполне шустро, и признаков интеллекта проявляет вполне достаточно.