在需要与用户长期交互的智能体中,必须能够从不断增长的对话历史中检索事实、偏好、事件以及变化。传统记忆系统往往把交互压缩为通用摘要,或直接返回匿名文本片段,导致智能体难以定位对应的实体、属性及其证据来源。EnSIMem 提出一种实体结构化的长期记忆架构,解决上述问题。
离线阶段,系统先将对话划分为主题连贯的情节(episode),随后为每个情节生成基于对话的索引条目,形式为 [实体][实体类型][属性:值]。每条目保留原始轮次、时间戳以及可能的多模态字段(如图片、音频),实现细粒度的可追溯性。
在线交互时,智能体的查询会被拆解为若干证据需求,这些需求对应索引中的属性。系统执行实体‑属性查找并进行自适应检索,收集满足点式、时间、组合及聚合推理所需的证据。最终,智能体直接基于保留下来的原始证据生成回复,而非依赖信息损失的记忆摘要。
在长期记忆基准测试中,EnSIMem 在保持上下文紧凑、在线效率高的前提下,实现了显著的答案准确率提升。实验表明,实体结构化索引和情节级别的来源追溯为智能体的长期记忆提供了可靠的技术支撑。代码已开源于 https://github.com/RamonMeng/EnSIMem。
点评:EnSIMem 通过将对话转化为可查询的实体属性表,实现了高效、可解释的长期记忆检索,为构建具备持续记忆能力的对话系统提供了实用范式。