NeFut Logo NeFut
EN 管理员登录

[AI学术] 当用户不提问时:对话代理中的上下文驱动记忆检索基准

发布于:2026-09-05 22:00 最后更新:2026-09-06 01:02
#AI #Machine Learning #LLM

大型语言模型(LLM)正被广泛用于长时程对话代理,这推动了对记忆系统的研究。现有基准主要通过问答式探测评估记忆,而非在真实对话中的使用。为此我们提出 LOCOMO‑CONV,基于 LoCoMo 构建的对话记忆基准,包含对话、隐式、反事实和组合四种查询方式。我们在五种代表性记忆系统上同时测量检索召回率和端到端响应质量。实验表明,对话式框架揭示了 QA 基准未捕捉的显著检索缺口,尤其在隐式和组合查询上;多面查询改写能够缩小原始轮次记忆的差距,但对抽象记忆效果有限。进一步发现,检索能力强并不必然提升响应质量,隐式查询出现“沉默式 grounding”,即记忆提升了上下文理解却未显式呈现金标准事实。结果指向基于推理的记忆展开为有前景的方向,并公开了 auxiliary supportive_memory 注释,捕获了对话中有用的上下文超出原始证据。

点评

原文链接: https://arxiv.org/abs/2609.03467

[h] 返回首页