大型语言模型(LLM)在能力上取得显著进展,但在实际部署时面临效率瓶颈。自回归解码导致推理延迟高,在小批量情况下难以充分利用硬件加速器;离散扩散模型虽可并行生成,却需要大量去噪步才能接近自回归质量;长上下文推理又会产生内存瓶颈,压垮最先进的加速器。
本文提出自组织语言模型的概念:模型在生成过程中为每个 token 标注语义依赖,即该 token 依赖哪些先前的 token。运行时根据这些标注动态决定执行策略,从而在保持质量的前提下实现并行化、缓存淘汰或扩散去噪顺序的优化,达到质量‑效率的 Pareto 最优。
基于该思想,本文实现了三套系统:
-
PASTA:在自回归解码时让模型预测哪些输出块可以独立生成。运行时并行调度这些块,显著降低解码时延。
-
TIP:利用依赖标注识别中间推理步骤在 KV 缓存中的冗余位置,主动驱逐这些无关上下文,削减显存占用且几乎不损失准确度。
-
Planned Diffusion:在离散扩散生成前,模型自回归生成一份“计划”,指明各块的去噪顺序。运行时按计划并行执行去噪,减少扩散步数,提升质量‑效率比。
实验表明,这三种自组织系统在不同任务上均实现了比传统自回归或离散扩散更优的质量‑效率折中,验证了语义依赖标注作为推理调度信号的有效性。
点评