摘要
免疫提示是一种用于对抗新兴不一致的选择性泛化技术。我们引入了免疫适配器(IA),这是一系列方法,通过在训练期间加强不希望的特征来减少学习不希望特征的优化压力。
免疫适配器是通过以下三个步骤训练和使用的 LoRA:
- 在不希望的特征上进行训练;
- 在训练一个单独的任务适配器时,保持免疫适配器冻结,该任务适配器在同时展现期望和不期望特征的数据上进行训练;
- 在部署时丢弃免疫适配器,仅保留任务适配器。
我们将免疫适配器与四种选择性泛化基线进行比较:免疫提示、预防性引导、概念消融微调(CAFT)和 KL 正则化。在九个设置和五个模型家族中,免疫适配器家族在期望特征保留与不期望特征抑制之间形成了新的帕累托前沿,尽管考虑到广泛的置信区间,改进的幅度仍然不确定。
免疫适配器还避免了免疫提示的两个缺点:它们可以抑制无法通过提示可靠引出的能力和特征,并且引入更少的意外后门。然而,没有任何免疫适配器变体能够完美优化所有目标;期望特征的泛化提升通常伴随着对不期望特征抑制的减弱和后门出现的增加。
博主点评: 免疫适配器的提出为减轻模型学习不希望特征的问题提供了新思路,尤其是在面对复杂的任务时。尽管有提升,但在优化多个目标时仍需权衡,未来的研究可以进一步探索不同特征之间的平衡与影响。