HOLA: линейное внимание с эпизодическим кэшем для длинного контекста

HOLA — ещё одна попытка починить длинный контекст не только через «больше памяти», а через более аккуратный выбор того, что именно хранить. Архитектура сочетает рекуррентную основу Gated DeltaNet с эпизодическим KV-кэшем на 64 самых информативных токена: для отбора используют метрику surprise, а для чтения — нормализацию, близкую к argmax.

Авторы пишут о снижении перплексии на Wikitext-103 на 16,1% и о стабильной работе до 32k токенов почти без роста параметров. Это как раз тот редкий случай, когда длинный контекст улучшают не просто раздуванием окна, а более умной организацией памяти.

Источник: gonzo-обзоры ML статей

Все новости: ai.popovs.tech

#LLM #AI #MachineLearning