参数高效微调(PEFT)通过在预训练模型上只更新少量参数,实现了相较于全模型微调更低的计算和存储成本。传统的低秩适配器大多采用乘法形式,仅针对单一任务进行学习,缺乏对任务间共享信息与任务特有信息的显式建模。\
JIVEAdapter 受统计方法 Joint and Individual Variation Explained(JIVE)的启发,提出一种 加性 的多任务低秩适配器。它将每一次权重更新 @@@MATH_BLOCK0@@@ 分解为两部分:\ \ $$ \Delta W = \underbrace{J}{\text{Joint 结构}} + \underbrace{I^{(t)}}_{\text{任务 $t$ 的 Individual 结构}} $$\ \ 其中 $J$ 为所有任务共享的 Joint 结构,$I^{(t)}$ 为第 $t$ 个任务的 Individual 结构。为保证两者在语义上保持可解释且相互独立,JIVEAdapter 在训练时对 Individual 结构施加近正交约束:\ \ $$ \langle J, I^{(t)} \rangle \approx 0 $$\ \ 适配器的秩在 Joint 池和各任务的 Individual 池之间自适应分配,使得共享信息和任务特有信息能够以最经济的方式表达。\
Joint 结构可以一次性在整个任务组上联合学习,也可以采用增量方式:先在已有任务上学习并冻结 $J$,随后在新任务上仅学习 $I^{(t)}$ 并通过一个方向尺度 $\alpha^{(t)}$ 调整其贡献,无需重新训练共享部分。\
在 DeBERTaV3‑base 上的 GLUE 与 SuperGLUE 基准实验表明,JIVEAdapter 在与单任务和多任务低秩基线相同的每任务有效秩下,能够达到竞争甚至更优的性能。相比需要额外专家混合(MoE)模块的方案,JIVEAdapter 只依赖 Joint 与 Individual 两个低秩矩阵,保持了模型结构的简洁。若出现相关的已知任务,其冻结的 Joint 可直接作为新任务的先验,仅通过复用该任务的 Individual 并加上一个廉价的方向尺度即可完成迁移;若无相关任务,则只需训练一个小规模的 Individual。\
点评:JIVEAdapter 通过显式分离共享与任务特有的低秩表示,实现了多任务微调的可解释性与参数效率,为实际部署提供了灵活的增量学习路径。