NeFut Logo NeFut
EN 管理员登录

[AI学术] 顺序知识编辑削弱模型辨别证据真伪的能力,却不影响准确率

发布于:2026-09-26 22:00 最后更新:2026-09-28 00:49
#AI #Machine Learning #LLM

本文研究了顺序知识编辑对大模型检索证据能力的潜在副作用。传统的编辑评估只关注三点:编辑后的事实是否改变、同义句是否保持、一致性答案是否不受影响。即使模型在这三项上全部通过,仍可能失去对未编辑事实的文档可信度判断能力。我们提出一种仲裁量度:在编辑前后,固定查询、检索段落和两个候选答案,比较模型对记忆答案与注入段落所述答案的对数几率差异。

实验使用保守调参的 LoRA,对 Qwen2.5-7B‑Instruct 进行 1,000 次顺序编辑。MMLU 分数保持四位小数不变,但未触及事实的仲裁量散布下降 36%。选择性预测性能随之下降,风险覆盖曲线下面积上升 0.107,而同等 MMLU 下降的范数匹配扰动仅提升 0.005;最自信四分之一仲裁决策的错误率从 0.217 增至 0.342。这并非整体能力损失。对五种扰动强度的随机噪声实验显示,导致 MMLU 从 0.6275 降至 0.3725 的损害,其对仲裁量的影响(0.088)仍低于 MEMIT 在 0.6050 时的影响(0.102)。

该现象在三组随机种子、两类模型、两套数据集、两种探针独立性标准、三种提示模板以及同义查询下均复现。对保存的权重增量进行层级消融发现影响是分布式的:没有单层能够单独复制该效应,去除任意一层可恢复约一半性能。使用冻结检索器时,检索准确率从 0.592 降至 0.46。

次要发现可能更具实践意义:在公开的超参数设置下,五组模型‑方法组合中有三组在 1,000 次顺序编辑后 MMLU 降至随机水平,但编辑成功率仍保持 1.00,局部性指标仍显示干净。若评估仅关注编辑成功而不测量能力,这类退化将被忽视。

点评:顺序知识编辑虽能保持传统准确率指标,却显著削弱模型对检索证据的辨别能力,提示未来评估需加入能力维度的测量。

原文链接: https://arxiv.org/abs/2609.29587

[h] 返回首页