NeFut Logo NeFut
EN 管理员登录

[AI学术] DyadMem:面向用户的长期记忆基准与双向代理记忆

发布于:2026-10-06 22:00 最后更新:2026-10-08 01:25
#AI #Machine Learning #LLM

DyadMem 旨在评估长期交互中代理对用户的记忆能力。传统基准只关注用户的事实或偏好,而忽略了关系特定的代理记忆——即在共享历史演化过程中,代理应如何与特定用户协同工作。为此,作者提出了 User‑conditioned Relational Agent Memory (URAM) 的新定义,并在同一多轮对话轨迹上同步标注用户侧记忆与 URAM,形成 6 类记忆标签。

数据集规模包括 3,065 条情景、50,961 场会话和 61,210 条问答实例。每个会话提供 Capture(捕获)与 Update(更新)的金标准标注,查询层面提供 Recall(召回)支持,并设置两种 QA 评估模式:Gold‑Memory(使用金标准记忆)和 Full‑Pipeline(完整记忆生成流程)。

在 16 种开源模型和 4 种商业模型上的实验表明,Gold‑Memory QA 表现普遍较好,但 Full‑Pipeline QA 下降显著,凸显了记忆生成环节的瓶颈。进一步的量化分析揭示了低 Capture 召回率、召回不完整以及不安全删除等问题,即使是最前沿的 LLM 也难以避免。

作者还通过严格实验验证了 URAM 的有效性,所有 20 种模型在引入 URAM 后均表现出正向提升。综上,DyadMem 是一个覆盖双域、全流程的记忆基准,提供了细粒度标注,为长期记忆研究提供了可靠评估平台。

点评:DyadMem 通过细致的记忆类别划分和全流程评估,填补了长期交互记忆基准的空白,为提升 LLM 在真实用户场景中的可靠性提供了重要参考。

原文链接: https://arxiv.org/abs/2610.03020

[h] 返回首页