NeFut Logo NeFut
EN 管理员登录

[AI学术] PReM:优化上下文压缩的保存与刷新策略

发布于:2026-07-18 22:00 最后更新:2026-07-22 01:24
#AI #Machine Learning #optimization

在高效的长上下文推理中,不仅仅是减少内存成本,还要在生成过程中保持有用的上下文证据。然而,现有的压缩方法,如键值(KV)缓存压缩和上下文压缩,往往提前决定保留哪些上下文信息,或依赖外部压缩器。这种设计使得后续推理步骤所需的压缩上下文难以适应。

本文提出了PReM(Preserve and Refresh Memory),一种上下文压缩框架,它将长上下文维持为模型内部层级的KV内存,并学习什么信息需要保留以及何时刷新。具体而言,PReM使用专门的内存层来做出内存选择决策,并使用特殊的内存标记在生成过程中触发刷新。为了训练这种行为,PReM引入了阶段分离刷新训练,旨在将内存选择与记忆条件生成对齐,同时在刷新过程中保持连续性。

实验显示,在32K-token上下文下,PReM在16x和32x压缩条件下均优于强基线,同时在答案质量与推理效率之间保持良好平衡。

博主点评: PReM的创新之处在于它对上下文的动态管理,尤其是在长上下文推理中,通过自适应的内存选择与刷新机制,显著提高了生成模型的性能与效率,展现出了出色的应用潜力。其设计理念为未来的上下文处理技术提供了重要的参考。

原文链接: https://arxiv.org/abs/2607.14327

[h] 返回首页