在当今的计算环境中,大型语言模型(LLMs)因其强大的推理与问答能力而被广泛应用。然而,在嵌入式和边缘计算环境中的部署却面临严格的延迟、内存与能耗限制。LLMs的庞大参数量和计算需求使得在资源受限的平台上高效执行变得困难。虽然模型剪枝被视为在保留性能的同时减少模型规模的可行方案,但联合优化层、注意力头和多层感知器(MLP)维度的复杂性仍然很高。全面探索这一综合设计空间不仅计算开销大,而且常常导致局部最优或不稳定的配置。
为了解决这些限制,我们提出了一种硬件感知的多目标结构化剪枝框架。该框架的两阶段方法明确针对延迟和模型大小进行优化,旨在高效部署于边缘设备。在粗粒度阶段,多目标深度剪枝移除整个注意力和MLP模块,以减少计算负载和内存使用。在随后的细粒度阶段,采用并行贝叶斯优化(PBO)方法在延迟限制下搜索最佳的层级剪枝比例,同时基于重要性策略对每层预算内需剪枝的具体组件进行排序。实验结果表明,我们的方法在保持常识推理任务和零-shot性能的同时,显著降低了模型复杂性。通过在多个LLM上以37.5%和50%的剪枝率进行测试,我们的方法在常识推理任务上优于现有方法,并显著降低推理成本。
博主点评: 该研究为资源受限环境中LLM的优化提供了有效的解决方案,特别是在延迟和模型大小之间实现了良好的权衡,展示了剪枝技术在实际应用中的巨大潜力。其采用的多阶段优化策略和并行贝叶斯优化方法,值得在未来的研究中进一步探索与应用。