Команда Yandex Research совместно с исследователями IST Austria и KAUST разработала и опубликовала в свободном доступе новые методы сжатия больших языковых моделей, позволяющие сократить бизнесу расходы на вычислительные ресурсы до восьми раз.
Решение компании включает два инструмента.
🟢 Первый позволяет получить уменьшенную до восьми раз нейросеть, которая быстрее работает и может быть запущена, например, на одном графическом процессоре вместо четырех.
🟢 Второй исправляет ошибки, которые возникают в процессе сжатия большой языковой модели.
Новые методы сжатия нейросетей уже доступны для применения — код опубликован на GitHub. Специалисты также могут скачать уже сжатые с помощью новых методов популярные модели с открытым исходным кодом. Кроме того, исследователи Yandex Research выложили обучающие материалы, которые помогут разработчикам дообучить уменьшенные нейросети под свои сценарии.
Источник: пресс-служба Яндекса