在高效的长上下文推理中,不仅仅是减少内存成本,还要在生成过程中保持有用的上下文证据。然而,现有的压缩方法,如键值(KV)缓存压缩和上下文压缩,往往提前决定保留哪些上下文信息,或依赖外部压缩器。这种设计使得后续推理步骤所需的压缩上下文难以适应。
本文提出了PReM(Preserve and Refresh Memory),一种上下文压缩框架,它将长上下文维持为模型内部层级的KV内存,并学习什么信息需要保留以及何时刷新。具体而言,PReM使用专门的内存层来做出内存选择决策,并使用特殊的内存标记在生成过程中触发刷新。为了训练这种行为,PReM引入了阶段分离刷新训练,旨在将内存选择与记忆条件生成对齐,同时在刷新过程中保持连续性。
实验显示,在32K-token上下文下,PReM在16x和32x压缩条件下均优于强基线,同时在答案质量与推理效率之间保持良好平衡。
博主点评: PReM的创新之处在于它对上下文的动态管理,尤其是在长上下文推理中,通过自适应的内存选择与刷新机制,显著提高了生成模型的性能与效率,展现出了出色的应用潜力。其设计理念为未来的上下文处理技术提供了重要的参考。