NeFut Logo NeFut
EN 管理员登录

[AI学术] 从检索上下文到运行时控制:面向边缓 RAG 的自适应压缩

发布于:2026-08-21 22:00 最后更新:2026-08-22 11:02
#AI #Machine Learning #optimization

检索增强生成(RAG)通过在外部文段上进行检索,使语言模型的输出更贴近真实信息,但随之而来的代价是检索到的上下文会显著拉长提示长度,导致预填充计算、KV‑cache 占用、内存带宽、响应时延以及能耗均大幅上升。上下文压缩通过在生成前裁剪检索文本提供了一条自然的缓解路径。然而,现有的压缩方法大多在离线设定固定的压缩率,或在推理时直接使用预先选好的比率,这种静态做法忽视了工作负载的波动以及边缘设备的实时状态。

在边缘 SoC 上,压缩本身并非免费:压缩器同样运行在同一芯片上,会消耗额外的时延和能量,可能抵消生成阶段的节省。本文提出了一种基于遥测信息的自适应压缩设想,并在 NVIDIA Jetson AGX Thor 上进行实证。实验使用 Llama 与 Qwen 两种生成模型,数据集选取 Natural Questions 与 HotpotQA,压缩工具采用 LLMLingua‑2。

测量结果显示,对于 7B‑8B 规模的生成模型,生成阶段占据了每次查询时延的约 90% 和 GPU 能耗的 91%。在不同压缩率下的实验揭示了一个自适应的工作区间:轻度压缩往往错失能耗优化机会,过度压缩则会显著降低推理质量。适度的中等压缩能够在几乎不影响生成质量的前提下,将 GPU 能耗降低最高 53.2%,整体 SoC 能耗降低最高 48.2%。

基于上述发现,本文主张在运行时动态管理压缩率,策略应当结合工作负载特征(如查询长度、模型规模)以及边缘设备的遥测数据(如 GPU 利用率、功耗阈值),实现对能耗与质量的协同优化。

博主点评:这篇工作把压缩成本搬到了边缘设备上进行细致量化,提供了实用的自适应压缩思路,对实际部署 RAG 系统的能效优化具有重要参考价值。

原文链接: https://arxiv.org/abs/2608.19535

[h] 返回首页