TurboQuant: в Google предложили решение для радикального снижения расходов на ИИ.

Google представил TurboQuant — новый подход к сжатию данных в ИИ, который позволяет резко уменьшить потребление памяти и ускорить работу моделей без потери качества.

В чем проблема.

Современные ИИ (особенно LLM) опираются на высокоразмерные векторы, которые занимают огромные объемы памяти.

Главное «узкое горлышко» - это KV-cache (кэш внимания), который быстро разрастается при работе с длинным контекстом.

Что предлагает TurboQuant

TurboQuant — это новая система векторной квантизации, которая:

• уменьшает объем данных в несколько раз • сохраняет точность почти на уровне 16-бит • не требует дообучения моделей работает «поверх» уже существующих моделей

Ключевая идея — упаковать информацию максимально плотно, устраняя лишние биты без потери смысла.

Как это работает (упрощенно)

Метод сочетает несколько идей:

Случайное вращение векторов → делает данные более равномерными • Johnson–Lindenstrauss преобразование → сжимает размерность, сохраняя расстояния • PolarQuant → переводит данные в полярную форму (удобнее для сжатия)

В итоге система кодирует данные почти на пределе теоретической эффективности.

Результаты: • до 6× меньше памяти • до 8× быстрее вычисления attention • ~3 бита на значение без потери качества

Почему это важно

• дешевле запускать большие модели • можно работать с более длинным контекстом • открывает путь к запуску ИИ на более слабом железе

Интересно, что авторы считают: мы почти достигли предела эффективности сжатия, и дальнейший прогресс потребует уже не оптимизации, а новых архитектур.

TurboQuant — это не просто оптимизация, а шаг к «предельной эффективности» ИИ-инфраструктуры: мы учимся не делать модели умнее, а делать их дешевле и быстрее без потерь.

Источник: https://research.google/blog/turboquant-redefining-ai-efficiency-with-extreme-compression/

TurboQuant: в Google предложили решение для радикального снижения расходов на ИИ | Сетка — социальная сеть от hh.ru TurboQuant: в Google предложили решение для радикального снижения расходов на ИИ | Сетка — социальная сеть от hh.ru