摘要
持续指令调优(CIT)要求多模态大型语言模型(MLLMs)能够在不遗忘先前能力的情况下适应一系列任务。常见策略是通过将输入路由到不同的LoRA专家来隔离更新。然而,现有的基于LoRA的混合专家(MoE)方法通常以不加区分的方式联合更新路由器和专家,导致路由器的偏好与专家的适应路径共同漂移,逐渐偏离早期的输入-专家专业化。我们称之为“不协调共漂移”,它模糊了专家的职责并加剧了遗忘。
为了解决这个问题,我们引入了路径激活子空间(PASs),这是一种受LoRA影响的子空间,反映了每个专家中输入激活的低秩路径方向,为路由和保留提供了能力对齐的坐标系统。基于PASs,我们提出了一种固定容量的基于PASs的MoE-LoRA方法,包含两个组成部分:
- PAS引导重加权:使用每个专家的路径激活信号来校正路由。
- PAS感知秩稳定化:选择性地稳定对先前任务重要的秩方向。
在CIT基准上的实验表明,我们的方法在准确性和抵抗遗忘方面始终优于一系列传统的持续学习基线和MoE-LoRA变体,且没有增加模型参数。我们的代码已公开可用,链接:GitHub Repository。
博主点评: 本文提出的路径激活子空间方法为持续学习中的专家路由问题提供了新的解决思路,通过精准的路径激活信号校正路由,显著提升了模型在面对新任务时的稳定性与记忆能力,具有较高的实用价值与应用前景。