NeFut Logo NeFut
EN 管理员登录

[AI学术] 即时记忆:为大语言模型代理学习任务自适应记忆策划

发布于:2026-09-24 22:00 最后更新:2026-09-28 00:49
#algorithm #Machine Learning #LLM

代理记忆系统通过复用过去的经验来提升未来的表现,但大多数现有设计在写入时就对记忆进行策划:任务完成后,其轨迹会被提炼为固定的产物,如反思、工作流、技能或推理策略,随后通过相似度检索使用。这要求系统在未来查询未知时就决定哪些信息值得记忆,导致信息不可逆地被丢弃,并产生一个必须服务于多种下游任务的查询无关摘要。写时策划的学习也十分困难,因为存储决策的价值往往只有在相关查询出现时才会显现,可能相隔多个任务,形成长时程的信用分配问题。

我们改为保留原始轨迹,并在读取时进行策划,此时当前任务已知。给定检索到的轨迹和新任务,记忆策划器会合成一个紧凑、任务自适应的负载,专门满足即时需求。由于该负载在同一任务中被消费,策划器可以直接依据任务成功率进行训练,避免了延迟的效用信号,也不需要人为地将任务进行分组。

在 ALFWorld、WebShop 和 $$\tau^2$$-bench 三个基准上,我们的即时记忆(JitMem)始终优于无记忆代理以及基于启发式或学习的写时记忆方法,分别提升了 16.2、16.3 和 3.9 个绝对成功率点。值得注意的是,即使是未训练的策划器也已能够与这些基线竞争或超越,说明任务自适应的读取时策划本身就是主要增益来源;进一步训练策划器则会带来额外提升。

点评:JitMem 通过将记忆策划推迟到读取阶段,成功解决了写时策划的长时程信用分配难题,实现了更高效的任务适配记忆利用,展示了在多任务环境中提升 LLM 代理性能的可行路径。

原文链接: https://arxiv.org/abs/2609.27334

[h] 返回首页