随着基于大语言模型(LLM)的代理被用于更长时间和更高风险的任务,它们的记忆系统仍然存在关键缺口。现有记忆基准大多关注回忆型任务,而我们认为有效的记忆系统必须能够追踪世界状态的演化——在长时间交互中,事实、约束和决策会被修正,答案必须反映当前状态而非已被取代的状态。我们将这种能力定义为状态追踪,并在 StateMemBench 中实现,它包含 234 个跨多轮对话的场景,覆盖两种对话长度。该基准采用闭池评分,判断答案是基于当前状态、已被取代的状态,还是其他错误,从而在设计上将状态追踪错误与其他错误区分开来。
实验表明,现有记忆系统、检索增强基线以及长上下文基线在该任务上均表现不佳。为此我们提出 StateMem,一种以状态为首的记忆方法,显式追踪取代关系和关联依赖。实验在 DeepSeek‑V4‑Flash 上将当前状态准确率提升 1.8 倍(0.205 → 0.363),在 Qwen‑3.5‑9B 上提升 1.6 倍(0.149 → 0.233),且仍与长上下文基线保持竞争。进一步,我们展示了将同一状态机制包装为轻量单次调用即可提升六种记忆和检索后端在 StateMemBench 上的当前状态准确率,提升幅度为 +32 到 +67 分。长度和成本匹配的对照实验表明,其中 +15 到 +32 分归因于状态结构本身,而非额外上下文。
博主点评:StateMem 的核心思想是把“哪个信息已经被新信息覆盖”显式建模,这在多轮对话记忆中尤为重要。实验结果显示,即使在不显著增加计算开销的情况下,也能显著提升对当前状态的把握,提示未来记忆系统应更多关注状态演化而非单纯检索。