MemAgent
🧬 MemAgent: Фреймворк на основе обучения с подкреплением, переосмысливающий обработку длинных контекстов в LLM
📝 Краткое содержание: Исследователи из ByteDance Seed и Университета Цинхуа представили MemAgent — фреймворк на основе обучения с подкреплением (RL), предназначенный для обработки сверхдлинных контекстов в больших языковых моделях (LLM). MemAgent имитирует человеческую память: он обрабатывает документы по частям, сохраняя ключевую информацию в сжатой памяти фиксированного размера и перезаписывая её по мере чтения новых данных.
Этот подход позволяет обрабатывать тексты практически неограниченной длины, сохраняя высокую точность и линейную вычислительную сложность, в отличие от существующих методов, которые страдают от падения производительности и высоких вычислительных затрат на длинных последовательностях.
📖 Подробности: Существующие подходы к обработке длинных контекстов в LLM, такие как экстраполяция длины или разреженное внимание, часто сталкиваются с падением производительности и высокими вычислительными затратами. В статье представлен MemAgent — фреймворк, решающий эту проблему с помощью стратегии, имитирующей человеческую память. Он обрабатывает документ по частям (чанками), используя внутреннюю память фиксированного размера для хранения сжатой важной информации. Ключевой особенностью является механизм пошаговой перезаписи (Segment-Wise Overwrite Mechanism), который позволяет обрабатывать тексты теоретически неограниченной длины без увеличения размера памяти, обеспечивая линейную вычислительную сложность.
Для обучения фреймворка применяется метод обучения с подкреплением (Reinforcement Learning) в рамках конвейера под названием DAPO (использующего Group Relative Policy Optimization). Этот подход рассматривает взаимодействие с каждым фрагментом текста как отдельный диалог, вознаграждая модель за сохранение только той информации, которая релевантна для ответа. В ходе оценки модель RL-MemAgent-14B, обученная на контексте 8 тыс. токенов, была успешно экстраполирована на тексты до 3,5 млн токенов. На бенчмарке RULER она сохранила более 95% точности и значительно превзошла другие модели. Так, на длине контекста 3,5 млн токенов MemAgent показал точность 78,1%, в то время как аналоги не справились с задачей. MemAgent можно применять к любой модели на основе Transformer без изменения её архитектуры.
🚀 Влияние: MemAgent предлагает масштабируемое и эффективное решение "трилеммы длинного контекста", обеспечивая обработку входных данных неограниченной длины с почти безошибочной точностью и линейной вычислительной сложностью. Это позволяет большим языковым моделям читать, обобщать и генерировать текст на основе многомиллионных токенов без необходимости изменения их базовой архитектуры.
🧩 Технологии: • Reinforcement Learning • Transformer • Group Relative Policy Optimization (GRPO)
🧑💻 Целевая аудитория: • Исследователи ИИ • Разработчики LLM • Стартапы