NeFut Logo NeFut
EN 管理员登录

[AI学术] Spectral-LSH:通过Krylov投影实现亚二次提示压缩

发布于:2026-07-23 22:00 最后更新:2026-07-26 07:44
#AI #Machine Learning #optimization

摘要

长提示推理的成本依然昂贵,因为预填充注意力随着序列长度呈二次增长。我们提出了一种名为Spectral-LSH的无训练提示压缩方法,该方法在提示进入语言模型之前进行操作。Spectral-LSH利用Krylov子空间方法结合随机特征来近似隐式注意力核算子的主导成分,从而避免了显式的 $O(N^2)$ 注意力核物化。接着,它在得到的注意力特征空间中应用SimHash,将相似的标记分组并聚合成具有因果位置分配的宏标记。

我们在C4上评估了Mistral-7B-Instruct-v0.3、Qwen2.5-7B-Instruct和Qwen2.5-14B-Instruct。实验结果揭示了一个压缩比相变。在 $\rho = 4 \times$ 以下,局部标记冗余较低,轻量级分块通常提供最佳的延迟与质量权衡。而在 $\rho = 8 \times$ 以上,光谱路径保留了分块所损失的质量。在 $\rho = 16 \times$ 时,Qwen2.5-7B(自适应)将PPL比率从353.409降低到196.963,而Qwen2.5-14B(自适应)则从9.533降低到3.427。在一个包含JSON样式、代码样式和表格样式输入的小型长上下文结构压力测试中,局部LSH在$8 \times$下也在所有指标上优于分块。

自适应后端通过在低压缩时使用分块路径,而在高压缩时使用光谱聚类,捕获了这两种情况,尽管分块在总延迟上仍然是最快的后端。

博主点评: Spectral-LSH通过创新的Krylov投影技术,显著降低了长提示推理中的计算成本,尤其在高压缩比下仍能保持质量。这种方法的高效性为大规模语言模型的应用提供了新的可能性,值得深入研究与应用。

原文链接: https://arxiv.org/abs/2607.19368

[h] 返回首页