🤖 Как алгоритм может сделать ИИ дешевле в 6 раз
Ни для кого не секрет, что основная боль ИИ‑решений сейчас это офигеть какие высокие требования к железу, большие языковые модели требуют огромных объёмов видеопамяти, а каждый дополнительный запрос в продакшене это реальные деньги на GPU и дата‑центры
А теперь гейм ченджер! Google Research представил TurboQuant это алгоритм экстремального квантования KV‑кэша в LLM Если вы не поняли что это значит, то вы не одиноки😂 Короче, это алгоритм который помогает экономить память в нейросетях, превращая большие числа в крошечные. Когда ChatGPT помнит ваш длинный диалог, он хранит промежуточные результаты (ключ-значение кэш) в виде чисел с высокой точностью и это занимает много видеопамяти GPU. TurboQuant округляет эти числа до 3–4 бит, вместо 16, и как бы сжимает, ну вроде как файл в зипе, но так, чтобы не потерять смысл. В итоге модель тратит в 6 раз меньше памяти и считает в 8 раз быстрее, оставаясь такой же умной
Ту же модель можно крутить на меньшем железе или обслуживать больше пользователей. После анонса акции производителей памяти (Micron, Samsung, SK Hynix) просели на 3–6%, а рынок на миг представил мир, где ИИ меньше жрёт (и дешевле стоит?;)
Что важно продактам ❗️Экономика меняется И порог входа для ИИ‑фичи падает, тем реальнее запускать мощные модели on‑prem ❗️Архитектура на годы Вы не привязывайтесь жёстко к одному стеку и такие оптимизации позволяют через год‑два на том же железе добавить больше умных фич ❗️Следите за ресёрчем А не только за моделями, но и за скучными алгоритмами сжатия (привет, Пегий Дудочник), потому что один такой может изменить P&L вашего продукта просто космически
Что почитать по теме 💬РБК. Google представила алгоритм сжатия памяти искусственного интеллекта 💬Хабр. Краткий гайд по квантованию нейросетей
Ciao💚