知识编辑通过修改模型参数,使特定事实更新而保持其他行为不变。编辑不仅是写入问题,还涉及地址问题:决定哪些隐藏状态应接受新残差。激活范围过窄会只记住单一提示,过宽会破坏相邻知识。参数编辑器隐式编码范围,记忆编辑器显式选择但位于模型外。我们提出 ALOE(Addressed Low‑rank Operator for Editing),它从同义句和硬负例中学习语义地址,通过 rollout 精炼和门校准将其对齐到自回归隐藏状态,并将得到的门控低秩算子嵌入单层 MLP,使模型在一次前向传播中完成编辑,无需检索器或路由器。实验在 CounterFact、ZSRE、KnowEdit 上,覆盖三类 7–8B 模型,效能 0.955‑0.999,局部性 0.981‑1.000。机制分析表明学习到的几何结构将冲突编辑分离,校准抑制超范围激活。剩余错误主要来自同义句覆盖和写入拟合。
点评