近期大型语言模型的进步显著提升了智能体在长期对话中的建模能力。现有方法大多采用静态启发式范式,信息被动归档且缺乏自适应的记忆价值评估,导致记忆管理无法随用户需求演化。为此我们提出 ICML(InteraCtive Memory Learning),一个将记忆机制从被动存储转变为可学习、交互式策略的多智能体框架。\ \ 首先,利用会话合成流水线生成专家数据,使模型在未见场景下能够快速进行测试时适配。随后,ICML 引入在线强化学习:\
- Planner 智能体 负责挑选高价值信息进行编码;\
- Trigger 智能体 动态检索已存信息以提升回复质量。两者在持续的交互反馈中共同进化。\ \ 关键在于采用延迟奖励机制,将未来的用户反馈向前传播至早期的存储决策,确保记忆策略与用户期望高度对齐。实验表明,ICML 在多项强基线上取得显著优势,并具备随着交互累积持续提升回复质量的独特能力。\ \ 点评:ICML 通过多智能体协同与延迟奖励,实现了记忆的主动学习与自适应管理,为长期对话系统提供了可持续改进的路径。