摘要
生产AI智能体的失败,往往不是因为推理能力不足,而是因为无法管理推理上下文中的信息:对话历史、大型提示、工具定义及其不断膨胀的输出。智能体在不断积累的历史中沉沦,同时每次交互的代币成本都在增长,导致在对话中出现缺失的回忆。现有的解决方案将此视为存储和检索问题,但我们认为这种框架过于狭隘。有效管理智能体所持有的信息是一种生命周期过程,而不仅仅是存储:它涵盖了决定记住什么、提取和结构化信息、根据数据类型选择合适的存储、整合和遗忘同时保持来源、判断当前相关性、预判未来需求以及在不失去重要信息的情况下压缩上下文以控制预算。
在实际应用中,这一过程不仅仅针对单一用户,而是跨越组织层级。我们将这一学科命名为智能体上下文管理(ACM),并将其分解为五个基本原理:架构设计、信息摄取、范围界定、预判和压缩与整合。接着,我们提出经济论证:简单的上下文积累使代币成本在对话长度上呈平方增长,而粗略的摘要方法则以准确性为代价实现线性成本,只有经过验证的压缩方法才能在保持保真度的同时实现线性成本。
我们描述了一个参考实现,Maximem Synap,它将这五个原理实现为一个多租户服务,并在第六节详细配置下报告了92%的LongMemEval和93.2%的LoCoMo的性能。最后,我们讨论了现有基准尚未捕捉的维度,包括延迟、代币效率和上下文衰退抵抗力,以及这一类别所指向的决策级和组织级上下文的前沿。
博主点评: 该文提出的智能体上下文管理(ACM)为解决智能体在复杂对话中面临的记忆与成本问题提供了创新视角。通过强调生命周期管理而非简单存储,展示了对话系统如何在保持效率的同时提升准确性,值得深入关注。