大型语言模型(LLM)正被广泛用作个性化助理,需在数月甚至数年的交互中持续服务。随着对话长度增长,完整历史的直接输入既耗算力又难以保证模型始终抓取到当前请求最相关的信息。为此出现了结构化记忆系统,用于存储并检索用户专属的上下文信息。实际使用场景中,用户往往需要的是推荐、计划或决策支持等实用指导,而非单纯的事实回忆。个性化指导要求模型跨越多轮对话整合信息,并推断用户偏好随时间的变化。现有的对话记忆评测主要关注检索准确度和事实回忆,未覆盖上述推理需求。为填补这一空白,我们推出 PRAGMA 基准。PRAGMA 包含精心挑选的长期对话记录、证据标注以及基于用户情境演变和错误假设设计的指导场景。实验在检索模型、记忆体系以及长上下文模型上进行,结果显示当前方法在找到合适证据和将其用于个性化指导两方面均表现不佳。该发现强调了需要能够支持稳健检索并在此基础上进行记忆驱动推理的记忆架构。
点评:PRAGMA 为评估长期对话中的个性化推理提供了首个系统化平台,揭示了现有记忆方案的局限,为未来的记忆‑推理融合模型指明了方向。