在大型语言模型(LLM)代理中,外部记忆系统在任务间积累经验的需求日益增长。然而,现有的方法几乎都依赖于固定的、手工设计的启发式方法来访问记忆。我们认为,这种静态的记忆观念是智能学习的核心瓶颈,因为最佳的记忆行为在本质上是依赖于上下文的。
任务的早期阶段,因记忆稀疏而受益于最小的检索;重复的目标类型更适合计划重用,而非通用的最近邻查找;受阻的代理需要通过替代查询进行重新检索;长任务流中,记忆存储本身必须被整合和修剪以保持实用性。
我们提出了“记忆作为受控过程”(MemCon)框架,将记忆操作建模为马尔可夫决策过程,并学习一种在线策略,适应性地决定何时、检索什么以及检索多少,何时注入提炼的计划,以及何时整合或遗忘。MemCon不依赖于后端:它可以包装任何现有的记忆实现,从任务到任务的二元反馈中学习,无需预训练和额外的LLM调用,并使用轻量级的表格上下文赌博机(UCB探索),在数十个任务内收敛。
在6个基准测试、3个代理框架和3个LLM基础上,MemCon在任务成功率上始终比多个记忆基线高出15.2个百分点,同时减少了5%到20%的令牌消耗。
博主点评: MemCon框架通过动态调整记忆管理策略,显著提升了LLM代理的任务执行效率。这种方法不仅减少了资源消耗,还提高了学习效果,展现了记忆管理在智能系统中的重要性和潜力。未来的研究可进一步探索记忆的上下文适应性,推动智能代理的进步。