NeFut Logo NeFut
EN 管理员登录

[AI学术] Moir:让模型自导故事,提升跨域知识编辑的鲁棒性

发布于:2026-07-25 22:00 最后更新:2026-07-26 07:44
#AI #Machine Learning #optimization

在语言模型的训练状态冻结之际,世界却在不断演变。知识编辑作为全量重训练的关键替代方案,面临着核心能力的削弱:数学和程序推理能力下降,而百科全书式的回忆依然保持完整。我们追踪这种不对称的退化现象,发现其源于分布不匹配。

基于协方差的编辑器仅保留其参考语料库所跨越的子空间,却无法捕捉到由后期训练(如 SFT 和 DPO)所塑造的操作分布。静态外部语料库,包括维基百科甚至原始的预训练混合数据,无法恢复这一变化的流形。

我们提出了 Moir,它通过从模型自身的解码分布中采样,直接估算保留协方差 $C$。通过用单个随机词汇标记作为种子生成,绕过了通常主导采样输出的指令遵循模板,揭示了模型内化的更广泛子空间。Moir 不需要外部数据,并且作为任何基于协方差的编辑器的即插即用组件,这在大多数现代 LLM 的预训练和后训练语料库并不公开的情况下,具有实际优势。

在 OLMo-2、Llama-3.1 和 Qwen-3(7-8B)上,Moir 在 MEMIT 和 AlphaEdit 的批处理和顺序模式下,始终在最脆弱的领域中扩展了保留,尤其是在 Qwen3-8B 上,在经历 20,000 次 AlphaEdit 批量编辑后,保持了 79.9% 的 GSM8K 准确率,而维基百科基线仅为 10.9%。这些结果表明,将保留分布与模型的操作分布对齐是非破坏性编辑的关键因素,而模型本身可能是已部署系统中最易获取的该分布源。

博主点评: Moir 的提出为知识编辑提供了新的视角,通过让模型自我导向,以减少对外部数据的依赖,展现了模型在动态环境下的适应能力。这种方法不仅提高了编辑的鲁棒性,也为未来的 LLM 应用开辟了新的可能性,值得进一步研究和探索。

原文链接: https://arxiv.org/abs/2607.20433

[h] 返回首页