摘要
变换器的适应性通常分布在模型的不同层级,即使预期的变化很狭窄。我们研究了适应位置如何影响模型的学习,学习的泛化能力,以及它的选择性应用。我们引入了一个控制基准,涵盖五个目标(词汇绑定、事实关联、行为策略学习、因果映射和程序推理),并定义每个目标的“适应几何”作为其在全堆栈和早期、中期或晚期 LoRA 下的获取、转移和有界性的特征。
这些目标展现了不同的几何特征。词汇绑定偏好早期层的适应以实现获取和有界性,但需要更广泛的更新以实现转移;事实关联则偏好局部适配器中的后期层;行为学习将晚期层的行动获取与中期层的策略门控分离;因果和程序转移则最受益于中期或全堆栈适应。这些模式在参数匹配的控制下大体保持不变,大多数相应的方向对比在五个模型家族中重复出现。这些发现确立了适应位置作为控制模型学习、泛化和保持不变的关键设计变量。
博主点评: 本文揭示了适应性在变换器模型中的重要性,特别是适应位置对学习特征的影响。通过系统的基准测试,研究者们为优化模型设计提供了有力的理论支持,值得关注其在实际应用中的潜在价值。