大型语言模型(LLM)推理常受计算和内存双重限制,尤其在基于 offloading 的部署场景中,模型权重需要在不同层次的存储之间来回迁移,导致每个 token 的解码延迟显著提升。减少实际执行的层数既能降低单 token 延迟,又能避免频繁的权重搬运,这一观察驱动了我们对早退出技术的重新审视。
FlexEE 通过三大机制使早退出在 LLM 解码中可行且高效:
- 层级退出监督——在每一层加入专门的预测头,并使用可靠的中间层监督信号,确保退出决策的准确性。
- 自我推测解码——在局部 Top‑K 词表上进行低成本的自回归推测,仅在置信度足够时触发退出,从而避免全局搜索的开销。
- 动态隐藏状态管理——在保持 KV‑cache 正确性的前提下,按需分配和回收隐藏状态,实现对显存的细粒度控制,兼容不同的权重 offloading 比例。
在生成任务和下游任务的实验中,FlexEE 能在几乎不损失精度的情况下实现显著加速。对 Llama2‑7B 与 Llama3‑8B 在 0% 与 50% 权重 offloading 条件下的端到端加速分别达到了 $1.27\times/3.16\times$ 与 $1.25\times/2.83\times$。
点评:FlexEE 将早退出与 KV‑cache 管理深度融合,为资源受限环境下的 LLM 推理提供了一条高效、实用的路径。