检索增强生成(RAG)通过在外部文段上进行检索,使语言模型的输出更贴近真实信息,但随之而来的代价是检索到的上下文会显著拉长提示长度,导致预填充计算、KV‑cache 占用、内存带宽、响应时延以及能耗均大幅上升。上下文压缩通过在生成前裁剪检索文本提供了一条自然的缓解路径。然而,现有的压缩方法大多在离线设定固定的压缩率,或在推理时直接使用预先选好的比率,这种静态做法忽视了工作负载的波动以及边缘设备的实时状态。
在边缘 SoC 上,压缩本身并非免费:压缩器同样运行在同一芯片上,会消耗额外的时延和能量,可能抵消生成阶段的节省。本文提出了一种基于遥测信息的自适应压缩设想,并在 NVIDIA Jetson AGX Thor 上进行实证。实验使用 Llama 与 Qwen 两种生成模型,数据集选取 Natural Questions 与 HotpotQA,压缩工具采用 LLMLingua‑2。
测量结果显示,对于 7B‑8B 规模的生成模型,生成阶段占据了每次查询时延的约 90% 和 GPU 能耗的 91%。在不同压缩率下的实验揭示了一个自适应的工作区间:轻度压缩往往错失能耗优化机会,过度压缩则会显著降低推理质量。适度的中等压缩能够在几乎不影响生成质量的前提下,将 GPU 能耗降低最高 53.2%,整体 SoC 能耗降低最高 48.2%。
基于上述发现,本文主张在运行时动态管理压缩率,策略应当结合工作负载特征(如查询长度、模型规模)以及边缘设备的遥测数据(如 GPU 利用率、功耗阈值),实现对能耗与质量的协同优化。
博主点评:这篇工作把压缩成本搬到了边缘设备上进行细致量化,提供了实用的自适应压缩思路,对实际部署 RAG 系统的能效优化具有重要参考价值。