在大语言模型(LLMs)中实现终身学习需要解决稳定性与灵活性之间的困境,即模型需要在不覆盖先前表征的情况下融入新知识,同时在参数增长受到限制的情况下保持可扩展性。现有的参数高效微调(PEFT)方法未能满足这一三重要求;共享参数的方法容易遭遇灾难性遗忘,而任务隔离的扩展则阻碍了知识转移,并且线性扩展。
我们提出了一种名为子专家混合(Mixtures of SubExperts, MoSEs)的模块化和稀疏框架,它将模型容量分解为可重用的组合原语。MoSEs通过轻量级的子专家和一个学习的子路由功能增强了变换器层,动态选择并组合基于任务输入的稀疏模块子集。这种方法引入了参数空间的结构化分解,使知识局部化但可访问,从而减轻了干扰,同时保持了重用的能力。
具体而言,MoSEs通过三个支柱平衡了这一困境:(i) 通过在稀疏激活模块内隔离知识实现稳定性,(ii) 通过路由驱动的重组和选择性扩展实现灵活性,(iii) 通过有效容量的亚线性增长实现可扩展性。值得注意的是,路由机制使组合泛化成为可能,允许新任务表示为以前获得的子功能的组合。我们在TRACE和SuperNI上对MoSEs进行了实证验证,结果显示相较于强大的PEFT基线,MoSEs减少了遗忘,提高了前向转移,并且在参数效率上表现更佳。
MoSEs建立了一个新的Pareto边界,实现了最先进的性能,同时保持了严格的参数预算。我们的结果表明,模块稀疏性和组合路由是构建能够持续学习而不饱和的基础模型的关键归纳偏差。
博主点评: MoSEs的提出为解决大语言模型的持续学习问题提供了新思路,尤其是在知识重用与干扰之间的平衡上。通过模块化与稀疏性,MoSEs不仅提升了模型的效率,还在性能上达到了新的高度,展示了未来大模型发展的潜力与方向。