摘要
长时程LLM智能体在推理过程中会积累大量的推理痕迹、动作和工具观察,这些信息有可能超出模型的固定上下文窗口。现有的压缩方法通常通过丢弃、总结或检索早期信息来应对这一限制,但这些方法可能导致任务关键细节的丢失或无法可靠地恢复。
我们提出了ARC(Addressable Recall Compaction),一个将归档存储与活动上下文展示分开的上下文管理框架。ARC将工具观察以追加的、ID可寻址的日志形式存储,并在需要压缩时用紧凑的引用替代较旧的观察。智能体随后可以使用这些标识符请求存储的内容,而无需重新执行相应的工具或仅依赖于基于相似性的检索。
我们使用Qwen3-8B(16k上下文窗口)和Qwen3-32B(32k上下文窗口)对ARC进行了评估。在“针在干草堆”评估中,ARC的平均准确率达到了99.40%,而我们评估中表现最佳的基线仅为88.12%。ARC还在我们的硬件成本模型下减少了估计的服务时间和HBM流量。在LongBench-v2 Hard子集上,ARC的平均准确率为29.97%,相比之下表现最佳的基线为28.25%。这些结果表明,在所测试的设置下,显式的基于地址的回忆能够提升信息保留和服务效率。
博主点评: ARC框架的提出为解决LLM智能体在长时程任务中的信息管理问题提供了创新思路,尤其是其对上下文的有效压缩与存储方法,可能会在实际应用中显著提高智能体的性能与响应效率。未来的研究可以进一步探讨如何优化ARC在更复杂任务中的表现。