摘要
检索增强生成(RAG)通过外部知识增强大型语言模型(LLMs),但面临知识冲突的问题:当检索到的信息与参数记忆相矛盾时,共享自注意力路径会产生不可预测的输出。我们提出了TokenMem,这是一种轻量级的记忆系统,通过专用的交叉注意力通道将知识注入冻结的LLM,避免了在残差流中的参数记忆竞争。
TokenMem仅训练一个薄的门控适配器(约3-7M参数),采用两阶段的课程学习:首先学习一般知识的利用,然后在反事实知识下增强可靠的合规性。在对五个模型(Qwen3-4B/8B/14B、LLaMA-3.1-8B、OLMo-3-7B)进行的控制实验中,TokenMem在反事实基准上实现了69-70%的知识合规性(KC),而传统RAG仅为20-52%,差距高达49个百分点。
消融研究表明,两阶段课程至关重要:去掉第二阶段会使KC降至接近零。机制分析揭示,门控适配器学习了一种冲突感知、层特定的注入策略,而无需显式监督。
博主点评: TokenMem的提出为冻结的LLM提供了一种新颖而高效的知识注入方式,尤其在面对知识冲突时展现了其独特的优势。这种方法的有效性不仅在实验结果中得到了验证,也为未来的模型设计提供了新的思路。其轻量级的设计使得大型模型的应用更加灵活,值得进一步探索。