NeFut Logo NeFut
EN 管理员登录

[AI学术] FlexEE:面向资源受限与分层卸载的自我推测式 KV 兼容早退出框架

发布于:2026-09-16 22:00 最后更新:2026-09-18 00:46
#Machine Learning #optimization #LLM

大型语言模型(LLM)推理常受计算和内存双重限制,尤其在基于 offloading 的部署场景中,模型权重需要在不同层次的存储之间来回迁移,导致每个 token 的解码延迟显著提升。减少实际执行的层数既能降低单 token 延迟,又能避免频繁的权重搬运,这一观察驱动了我们对早退出技术的重新审视。

FlexEE 通过三大机制使早退出在 LLM 解码中可行且高效:

  1. 层级退出监督——在每一层加入专门的预测头,并使用可靠的中间层监督信号,确保退出决策的准确性。
  2. 自我推测解码——在局部 Top‑K 词表上进行低成本的自回归推测,仅在置信度足够时触发退出,从而避免全局搜索的开销。
  3. 动态隐藏状态管理——在保持 KV‑cache 正确性的前提下,按需分配和回收隐藏状态,实现对显存的细粒度控制,兼容不同的权重 offloading 比例。

在生成任务和下游任务的实验中,FlexEE 能在几乎不损失精度的情况下实现显著加速。对 Llama2‑7B 与 Llama3‑8B 在 0% 与 50% 权重 offloading 条件下的端到端加速分别达到了 $1.27\times/3.16\times$ 与 $1.25\times/2.83\times$。

点评:FlexEE 将早退出与 KV‑cache 管理深度融合,为资源受限环境下的 LLM 推理提供了一条高效、实用的路径。

原文链接: https://arxiv.org/abs/2609.17008

[h] 返回首页