MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use (arxiv) Забавная статья, в которой исследуют влияние памяти в LLM.
Обычно и часто проверяют точность, полноту и релевантность извлечения. Но нужно еще проверять общие бизнес-метрики. И о чудо: если память нерелевантная, например все кейсы были про output с XML, а сейчас простой базовый вопрос, то это роняет метрики.
Например, для Gemini 3.0 Flash без памяти средний score 85,2%, а с разными memory-подходами он падает до 54,7-71,2%.
Решение в проверке необходимости текущей памяти модели.