扩散语言模型(DLM)提供了一种非自回归的生成方式,通过迭代去噪对 token 进行细化,而不是左到右的顺序解码。相较于基于 Transformer 的自回归大语言模型(LLM),DLM 能在同一时间并行更新多个不确定的 token,并在整个生成过程中利用双向上下文,从而实现比固定顺序解码更灵活的质量‑延迟权衡。
这些特性对移动边缘代理尤为重要:
- 部分细化和提前退出可以显著降低响应时延;
- 基于约束的纠错能够在噪声、信息缺失或动态环境下提升鲁棒性;
- 并行更新减少了对高带宽通信的依赖。
本文综述了 DLM 的理论基础,并从延迟、内存、能耗、带宽、隐私和可靠性等边缘约束出发,评估其在边缘场景中的适配性。重点包括:
- 轻量化网络结构与硬件加速器;
- 训练与推理加速技术,如混合精度、梯度检查点和分布式去噪;
- 模型压缩方法(剪枝、量化、蒸馏)以及在边缘/云协同部署中的权衡;
- 面向通信感知的服务调度,适配 IoT 与无线网络的带宽波动;
- DLM 驱动的代理评估指标,涵盖生成质量、响应时延和资源占用。
此外,本文还指出了若干开放问题:长上下文状态管理、跨设备分割推理、可信执行环境、多模态 grounding 与可重复基准测试。目标是将 DLM 的双向性、并行细化、可控性和质量‑延迟弹性等建模特性,与未来移动边缘智能系统的系统层需求相匹配。
点评