摘要
全微调仍然是适应预训练大型语言模型(LLM)的有效方法,但它会更新所有权重并且成本较高。LoRA减少了可训练参数的数量,但并没有直接回答在适应过程中哪些预训练组件应被训练,哪些可以保持不变。
我们提出了TopoTuner,一个基于拓扑的微调框架,用于选择性冻结注意力投影矩阵。该方法将每个投影矩阵视为一个行云,并利用持久性图之间的Wasserstein距离来测量其在微调过程中的拓扑变化。TopoTuner从源数据集中学习可重用的冻结配置,并将其转移到高效微调域外数据集,评估任务特定的拓扑漂移是否可以在问答和情感分析任务中推广。
在LLaMA-3.1-8B、Mistral-7B-v0.3和Qwen3-8B-Base上,TopoTuner在仅训练1-2%的模型参数的情况下,与全微调具有竞争力,并在9个模型-数据集设置中有7个超越了LoRA,最多可以改变39.57%的投影参数。通过减少更新,TopoTuner相较于全微调平均减少了20.4%的训练时间,相较于LoRA减少了5.5%。TopoTuner为可重用的冻结配置开辟了新方向,使得在一个数据集上学到的微调行为可以在多个任务中共享。
博主点评: TopoTuner通过引入拓扑学习方法,显著提高了微调的效率,特别是在参数更新和训练时间方面。这种方法不仅降低了计算成本,还为不同任务间的微调共享奠定了基础,具有广泛的应用潜力。尤其在资源有限的情况下,TopoTuner展现出强大的适应能力与灵活性。