持续微调是让大语言模型(LLM)在真实环境中动态适应的关键,但会导致灾难性遗忘,表现为先前任务性能下降和通用知识流失。现有方法如正交梯度投影虽能减轻任务间遗忘,却无法保留预训练阶段的通用知识,因为它们需要原始数据和梯度,而这些信息对离线模型是未知且多样的。为此我们提出 EoupCT(Estimate and Orthogonalize Unknown Pre‑training Gradients for Continual LLM fine‑Tuning),核心思路是:① 通过可学习的软提示(soft prompt)并结合 Gumbel‑Softmax 松弛,动态生成最易被新任务遗忘的伪数据,从而估计预训练梯度;② 将任务损失、新任务梯度与估计的预训练梯度构建为多目标优化问题;③ 引入一阶高效 Pareto 优化器,同时更新模型参数和软提示,严格约束新任务更新与估计的预训练梯度正交。实验在多种 LLM 上验证,EoupCT 能同时保持任务专精能力和通用知识,有效缓解灾难性遗忘。
点评