摘要
知识注入通过更新预训练的多语言大模型(MLLMs)来融入新的事实或特定领域知识,但完全拟合权威答案可能导致未更新行为的漂移。在线蒸馏可以通过对模型生成的回放进行训练来减轻这种漂移,然而,统一的参考条件蒸馏提供了粗糙的监督:它可能会低估参考支持的回放标记,并且仅间接监督被省略的事实。
我们提出了 RoCo-ACE,这是一种针对知识注入的回放条件在线蒸馏目标。RoCo 使用同回放的无参考/有参考似然对比,重新分配蒸馏权重给参考支持的回放标记,而 ACE 则为在回放中省略的权威锚点添加稀疏的参考侧锚定修正,而无需完全模仿答案。
在三种知识注入设置、六个保留基准、多个基线和多个基础模型中,RoCo-ACE 实现了相比其他方法最佳的注入知识准确性,同时保持评估的保留度接近基础模型。
博主点评: RoCo-ACE 通过创新的回放条件蒸馏方法有效解决了知识注入中的漂移问题,证明了在保持模型行为稳定性的同时提升知识准确性的可能性,为未来的多语言模型优化提供了新的思路。