本地助理能够让工厂工人通过对话方式访问机器文档,但能够胜任此任务的模型往往无法在车间硬件上运行。我们首先对模型进行结构压缩,并通过检索引导的适配使其在本地部署。实验表明,压缩后模型的总体能力随参数量几乎线性下降,而在检索增强后的答案质量并不随模型大小变化。于是我们将部署视为一次后适配的子网络选择问题:在满足可配置的通用能力下限和内存预算的前提下,根据实际测得的设备吞吐量和人工评估的答案质量,为每个设备分配一个子网络。单纯优化尺寸、速度或质量的规则都会导致能力或吞吐量的牺牲。我们使用权重共享的超网络,并通过 sandwich‑style 原位蒸馏进行训练,使得子网络的选择成本保持低廉。
在制造手册的案例研究中,压缩导致的质量下降占未剪枝模型评估质量的 13.7%。通过检索引导的蒸馏,质量恢复至仅低于原模型 4.6%,相当于弥补了约三分之二的损失。该助理能够在三类异构边缘设备上运行,待机功耗在 1.3 W 到 5 W 之间。
点评