边缘 AI 的模型选型往往只关注单一指标,如准确率、延迟、内存、能耗或安全性,然而可部署的语言模型必须在这五个维度之间取得平衡。本文聚焦于一个核心问题:相较于经后训练量化的 大语言模型(LLM),小语言模型(SLM) 是否在可持续的边缘部署上更具优势?
我们提出了 全局可持续性评分(Holistic Sustainability Score,HSS),围绕三重底线展开:
- 经济层面:能力(零样本基准)与系统效率(延迟、吞吐、峰值显存、能耗)
- 环境层面:运行时 GPU 能耗
- 社会层面:对有害提示的鲁棒性(攻击成功率)
实验对象包括 5 种 BF16 SLM 与 5 种在不同量化方案下的 LLM(BF16、INT8、NF4 4‑bit、GPTQ 4‑bit、GGUF Q4),共计 30 种配置。能力通过五个零样本基准评估,效率使用延迟、吞吐、峰值显存和能耗度量,安全性则通过五条有害提示的攻击成功率近似。
结果:
- 综合得分最高的是 Qwen3-30B-A3B/GGUF Q4(93.38),其次是 Mistral‑Small‑24B/GGUF Q4(92.40)。
- 在 SLM 中表现最佳的是 Phi‑4‑mini/BF16(89.49)。
- 这表明“原生 SLM 必然是最可持续的边缘选择”这一假设并不普遍成立;经过优化的量化 LLM 在整体上可以胜出,而 SLM 仍凭借更低的资源需求保持竞争力。
结论:量化是一种系统层面的决策,而非单调的精度‑效率权衡;HSS 的数值相对其比较池和代理定义而变化。未来工作应进一步细化指标并探索跨模型的协同优化。
点评