在个人计算机上,轻量级大语言模型(LLMs)的部署日益增多,尤其是在资源受限的边缘和移动环境中。在这些环境中,能耗、执行时间和内存使用直接影响实际可用性。然而,现有的LLM效率评估主要依赖于参数数量或FLOPs等代理描述符,往往与任务精度脱节。本文提出了一种基于PTME的实验框架,用于精确分析轻量级LLM的推理,联合测量精度、执行时间、峰值内存使用和能耗,通过直接的硬件级测量进行评估。
该方法应用于一组代表性的轻量级LLM,这些模型在受控的桌面平台上执行,资源限制为边缘级,基准测试涵盖了代码生成、数学推理和多任务理解。我们发现,静态代理描述符很好地近似了推理成本,但未能预测精度。收紧资源限制会增加成本而不影响精度,执行时间的增加比能耗更显著,并对较大的模型影响最大。此外,没有单一模型在所有PTME维度上占据主导地位,帕累托分析揭示了在仅依赖准确性或效率评估中被隐藏的非支配配置,提供了在不同资源限制下选择模型的实用指导。这些结果表明,单凭模型大小、FLOPs、延迟或准确性来选择轻量级LLM可能会导致错误的部署候选;PTME分析揭示了在较低物理成本下保持有效准确性的配置。
博主点评: 本文为轻量级大语言模型的性能分析提供了新的思路,尤其是在资源受限的环境中,强调了精度、时间和能耗的综合考量,具有重要的应用价值和学术意义。