摘要
长时记忆对于跨会话互动的 LLM 代理至关重要,但当前的记忆基准主要评估单跳回忆,导致多跳关联的测量几乎为空。我们提出了三个重要贡献。
首先,我们引入了 MemHop,这是一个多跳记忆基准,包含 1000 个问题,跳跃深度为 1-5,涵盖 10 个社交网络场景,并附有每跳证据注释。
其次,我们展示了 Profile-Graph Memory(ProGraph),这是一种两层记忆架构,结合了以下两部分:
-
Profile Expansion - 对实体名称的子串匹配遍历,这些名称自然出现在 LLM 生成的个人资料叙述中,作为显式知识图谱构建的最小替代方案;
-
Compression Residuals - 在每次个人资料更新时共同提取的确切日期、数量和命名项,且不增加额外的 API 成本。
最后,通过全网格消融实验显示了跨基准机制的专业化:当移除 profile expansion 时,导致多跳推理下降 22.6 个百分点,而当不共同提取 compression residuals 时,精确回忆下降 8.6 个百分点,单一架构内的交叉效应低于 3 个百分点。ProGraph 在 MemHop 上平均得分 80.1%(匹配 FullContext 基准),在 LoCoMo 上得分 78.4%(超过 FullContext 11.3 个百分点),在这两项评测中均优于 Mem0、A-Mem、HippoRAG 和 RAG。我们发布了 MemHop、ProGraph 和基线实现。
博主点评: 本文提出的 ProGraph 通过高效的记忆管理和多跳推理机制,展示了 LLM 在复杂任务中的潜力,尤其是在社交网络场景下的应用。MemHop 基准的引入为后续研究提供了重要参考。如何优化记忆的提取和利用,将是未来 LLM 发展的关键。