⚡️Yandex Research нашли способ сжимать нейросети без потери качества ответов
Специалисты Yandex Research совместно с коллегами из IST Austria и Kaust выложили в открытый доступ новые методы сжатия больших языковых моделей.
Зачем это?
Большая языковая модель требует больших мощностей — дорогостоящих процессоров. А это всегда расходы для бизнеса. Новая разработка позволяет сжать нейросеть в 8 раз и включает два инструмента:
🔵Первый — уменьшает языковую модель и позволяет запускать ее всего на одном графическом процессоре. 🔵Второй — исправляет возникающие при сжатии ошибки.
Качество ответов нейросети при этом почти не страдает — сохраняется до 95%.
Код нового метода сжатия нейросетей уже опубликован на GitHub и доступен для применения.
Ну что, ждем по llmке в каждой микроволновке и кофеварке? Подписывайтесь: "Как приручить ИИ"