NeFut Logo NeFut
EN 管理员登录

[AI学术] 探索极限:LoRA、目标模块与量化在60M参数模型中的权衡研究

发布于:2026-07-30 22:00 最后更新:2026-07-30 23:39
#AI #Machine Learning #optimization

摘要

参数高效微调(PEFT)与低比特量化已成为在计算预算紧张的情况下调整语言模型的标准工具,然而它们的交互通常是在数十亿参数模型上进行研究,这种设计空间的探索成本高昂。我们提出一个互补问题:在一个特定的、完全可重复的60M参数编码-解码模型(T5-small)和单表文本到SQL基准(WikiSQL)上,每个效率调节对任务准确度的实际成本是多少?

我们进行了一项受控的单变量研究,研究内容包括:

  1. LoRA秩 r 取值为 {2, 4, 8, 16, 32},
  2. 适应模块集合,
  3. 数值精度。

我们报告了任务准确度以及系统级指标,包括可训练参数、峰值训练内存、推理延迟和吞吐量,并将适应视为一种受限的权衡,而不只是追求准确度的目标。

我们的结果显示,使用 r=16 的 LoRA 在全微调准确度的基础上恢复了 11.6 个百分点(59.6% 对 71.2% 的完全匹配),同时训练的参数少于1%,并且峰值GPU内存消耗减少了31%。在此设置下,秩超过 r=16 不会带来可测的准确度提升。使用INT8和NF4量化的QLoRA实现了相当的准确度(52.8% 和 53.2%),同时内存成本显著降低(每个仅0.60 GB),展示了在内存受限部署中的诱人权衡。所有代码、配置和日志均已发布,以确保完全可重复性。

博主点评: 本文提供了在资源受限环境下微调大规模语言模型的新视角,LoRA和量化技术的结合为实际应用提供了重要参考,尤其是在内存和计算能力有限的场景中。

原文链接: https://arxiv.org/abs/2607.25583

[h] 返回首页