MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use (arxiv) Забавная статья, в которой исследуют влияние памяти в LLM.

Обычно и часто проверяют точность, полноту и релевантность извлечения. Но нужно еще проверять общие бизнес-метрики. И о чудо: если память нерелевантная, например все кейсы были про output с XML, а сейчас простой базовый вопрос, то это роняет метрики.

Например, для Gemini 3.0 Flash без памяти средний score 85,2%, а с разными memory-подходами он падает до 54,7-71,2%.

Решение в проверке необходимости текущей памяти модели.

MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use (arxiv)
Забавная статья, в которой исследуют влияние памяти в LLM.
Обычно и часто проверяют точность, полноту и релевантность извлечения | Сетка — социальная сеть от hh.ru