Локальный ИИ: капелька железа
Штош! Исходная работа локальной языковой модели осуществлялась на процессоре Intel i3, единственным плюсом было 64Гб оперативной памяти. Но скорость генерации была совсем невысока. Для простых запросов это было достаточно, но для задач реализации небольших проектов по разработке, то скорость генерации стала узким местом. Я мог запустить задачу вечером, но утром задача не была закончена. Или, что хуже, утром была какая-то ошибка, вида 500 - ошибка сервера. После долгих взвешиваний за и против была выбрана видеокарта с 24Гб видеопамяти. Критерия было два: минимальный бюджет за максимальный объем видеопамяти.
Дальше была распаковка, установка и запуск. Все заработало сразу, но было непросто. Для докер контейнера было настроено использование ведокарты. После запуска выполнения промпта UPS тотчас-же сообщил о перегрузке и выключился. Хорошо, переключил напрямую в розетку, без UPS, все заработало. Но было сильно шумно, потому что на видеокарте установлен вентилятор-улитка, и при 100% нагрузке он очень шумный. Очень.
Много описание о замене вентиляторов для уменьшения шума. Коротко: плохой вариант, охлаждения недостаточно. но я прошел этот пусть: вынул видеокарту, поставил другой вентилятор, но при этом плохо остужается видеопамять с другой стороны. Вернул как было.
Начал разбираться с программными настройками, при помощи утилиты nvidia-smi с ограничением максимальной мощности. Это работает, я смог переключить обратно из розетки на питание через UPS, с ограничение видеокарты по мощности, и UPS не перезагружался. Обнаружилась особенность: при ограничении мощности - вентилятор на видеокарте работал на 45% даже в простое. Это шумно для дома. Но если снять ограничение мощности, то вентилятор затихал.
Итоговый конфиг такой: чтобы не менять UPS на другой, с большей мощностью - то при запуске докер контейнера с LLM устанавливается ограничение мощности, вентилятор включается громко. Когда докер контейнер останавливается - ограничение снимается, вентилятор утихает.
Работа пошла веселее, ошибки начали появляться тоже быстрее ))