NeFut Logo NeFut
EN 管理员登录

[AI学术] 记忆控制信号在长时程代理行动前出现

发布于:2026-09-24 22:00 最后更新:2026-09-28 00:49
#AI #Machine Learning #LLM

长时程语言模型代理会不断累积交互历史,导致计算开销随时间增长,同时使得相关信息更难以保存和复用。现有的上下文管理方法主要聚焦于如何压缩或检索历史,却很少探讨模型本身是否已经在行动前编码了这些记忆操作的需求。我们对每一次代理行动前的隐藏状态进行分析,发现压缩需求和召回需求已经在内部表征中显现。这些信号既不能用简单的上下文长度或交互进度来解释,也在模型深度上呈现出不同的形成模式。进一步的实验表明,大部分记忆决策信息保存在一个紧凑的近期上下文中,而选择性地恢复历史证据则补足了近期上下文遗漏的长程依赖。基于这些发现,我们提出了 Preaction Memory with Evidence Retrieval (PaMER),该框架将状态引导的压缩与外部证据检索相结合。PaMER+ 在此基础上加入了步级证据选择,只恢复当前任务所需的历史信息。我们在 WorkBuddyBench 上对多种上下文管理基线和模型骨干进行实验,结果显示该框架显著降低了上下文消耗,同时保持了竞争性的任务性能。

点评: 该工作揭示了模型内部在行动前就能感知记忆需求的潜在信号,为构建更高效的长时程代理提供了新的思路。

原文链接: https://arxiv.org/abs/2609.27286

[h] 返回首页