长时程智能体会随着交互历史的增长而产生越来越大的上下文和推理开销。我们发现仅靠几何冗余并不足以保证安全压缩。虽然历史数据呈现强低维结构,但相似的全局几何可能包含截然不同的任务证据量。
在相同保留块数下,基于证据的选择将下一步动作的 Top 3 保留率从 0.31 提升至 0.69,而质心相似度仍保持在 0.98。受控替换实验进一步表明,动作相关信息可以被大幅修改,而全局几何度量几乎不变。
针对几何与证据之间的差距,我们提出了几何引导证据保留记忆(GEM),这是一种无需额外训练的压缩器。GEM 在使用几何残差完成覆盖之前,先保护任务和执行证据。实验显示,GEM 将每个任务的平均综合 token 使用量从 2.69M 降至 2.11M,下降幅度为 21.4%,同时保持了相近的任务奖励。
我们的结果表明,高效的智能体历史压缩应当以保留任务证据为目标,而非仅仅追求几何覆盖。
点评