持续后训练大型多模态模型需要在引入新能力的同时保持预训练得到的能力,这两个目标往往相互冲突。监督微调(SFT)提供明确的目标监督,能够从几乎为零的准确率学习任务,但其离策略较远的目标会导致遗忘。相反,基于策略的方式如 RLVR 和自蒸馏能够保持策略接近性,却在模型尚未解决任务时提供的信号很少。
我们提出 ReDraft(Reference‑Driven Revision and Fine‑Tuning),它从模型自身的错误中获取两者的优势:仅把专家答案作为参考,让模型对自己的错误输出进行修订;若验证器接受该修订,则保留并在其上进行微调。每一个保留下来的目标既是显式的,又与当前策略保持接近。
在 Qwen2.5‑VL‑3B/7B 上的 Counting、Clock Reading 与 Jigsaw 三个任务中,其中两个任务的初始准确率接近零,ReDraft 在目标任务上取得 56.9 分,相比 SFT 的 52.9 分有显著提升;同时将先前任务的损失从 16.6 降至 1.5(遗忘降低 11.3 倍),并在 OPSD 的两个指标上均有改进(增益 19.3,损失 6.2)。
数据和参数空间的分析表明:修订后的目标在基础模型下的概率更高,产生的更新更紧凑,并且在方向上更贴近 SFT 而非 OPSD。关键在于修复模型自身的输出,而不是用专家答案直接替代,这使得同一目标能够兼顾学习新任务和保持旧能力。
点评