TurboQuant: в Google предложили решение для радикального снижения расходов на ИИ.
Google представил TurboQuant — новый подход к сжатию данных в ИИ, который позволяет резко уменьшить потребление памяти и ускорить работу моделей без потери качества.
В чем проблема.
Современные ИИ (особенно LLM) опираются на высокоразмерные векторы, которые занимают огромные объемы памяти.
Главное «узкое горлышко» - это KV-cache (кэш внимания), который быстро разрастается при работе с длинным контекстом.
Что предлагает TurboQuant
TurboQuant — это новая система векторной квантизации, которая:
• уменьшает объем данных в несколько раз • сохраняет точность почти на уровне 16-бит • не требует дообучения моделей работает «поверх» уже существующих моделей
Ключевая идея — упаковать информацию максимально плотно, устраняя лишние биты без потери смысла.
Как это работает (упрощенно)
Метод сочетает несколько идей:
• Случайное вращение векторов → делает данные более равномерными • Johnson–Lindenstrauss преобразование → сжимает размерность, сохраняя расстояния • PolarQuant → переводит данные в полярную форму (удобнее для сжатия)
В итоге система кодирует данные почти на пределе теоретической эффективности.
Результаты: • до 6× меньше памяти • до 8× быстрее вычисления attention • ~3 бита на значение без потери качества
Почему это важно
• дешевле запускать большие модели • можно работать с более длинным контекстом • открывает путь к запуску ИИ на более слабом железе
Интересно, что авторы считают: мы почти достигли предела эффективности сжатия, и дальнейший прогресс потребует уже не оптимизации, а новых архитектур.
TurboQuant — это не просто оптимизация, а шаг к «предельной эффективности» ИИ-инфраструктуры: мы учимся не делать модели умнее, а делать их дешевле и быстрее без потерь.
Источник: https://research.google/blog/turboquant-redefining-ai-efficiency-with-extreme-compression/