许多长时序 LLM 部署受限于提示预算——延迟、成本和上下文长度上限使得随着交互长度增长,完整上下文提示变得不可行。此时关键不再是单纯的召回能力,而是 在紧凑记忆 regime 下,哪种记忆设计能在质量与 token 消耗之间取得最佳平衡。
我们提出 RSM-full,一种面向质量‑token Pareto 最优点的在线聚类记忆流水线。RSM-full 由两大设计组成:
- 余弦门控的 max‑member merge 写入规则——在写入新 token 时,仅当其与已有簇中心的余弦相似度最高且超过阈值时才合并,从而保持簇的代表性。
- 原子感知的分组上下文打包器——在打包上下文时,以原子(atom)为单位进行分组,确保同一原子内部的 token 紧密相连,提升检索和拼接效率。
在我们的主要紧凑记忆基准 AMA‑Bench 上,RSM-full 在 $4$k token 预算下实现了 $83\%$ 的全上下文质量,却只消耗了 $32\%$ 的 token 成本。四种随机种子平均后,它相较于最接近的流式聚类基线 Online K‑Means 提升了 $+3.5$–$6.0$ 个百分点($p<0.05$)。
该结果表明,在受限的 token 预算下,RSM-full 能够显著压缩记忆占用,同时保持接近完整上下文的推理质量。
点评