摘要
长时记忆使得大型语言模型(LLM)代理能够重用过去的交互记录,但原始对话历史往往冗长且信息稀疏。广泛检索虽然可以提高证据覆盖率,但会因为噪声淹没下游推理;而在写入时压缩虽然可以减少噪声,但不可逆地丢失未来查询可能需要的细节。我们提出了LazyMem,巧妙地通过将所有记忆构建推迟到查询时来规避这一困境。
一个轻量级的4B模型在重叠的并行窗口中处理检索到的候选池,选择性地保留和压缩仅与查询相关的内容。该模型通过监督微调和基于组的强化学习进行训练,采用格式门控复合奖励,该奖励结合了基于规则的动作信号(测量选择准确性)与由LLM判断的质量信号(测量源的可靠性和查询的实用性)。
在LongMemEval基准上,LazyMem-4B以仅213个记忆令牌达到了0.85的LLM判断准确率,较仅检索方法减少了68.7倍,并且在没有目标领域训练的情况下,能够泛化到LoCoMo(0.68),同时降低了平均延迟。32B变体在聚合重问题类型上达到了0.93,超过了基准的参考值。与此相关的代码已在GitHub上公开。
博主点评: LazyMem通过延迟记忆构建有效解决了长时记忆中的信息过载问题,展示了在复杂推理任务中如何提高模型的选择性与效率。这一创新方法不仅提升了模型的性能,还为未来的记忆管理策略提供了新的思路。