检索增强生成(RAG)通过检索文档为语言模型提供事实依据,降低幻觉风险,但也引入文档投毒攻击面。本文评估量化模型 Llama 3.1 8B 在检索上下文被部分毒化时的鲁棒性。采用三种毒化策略:实体替换、数字替换、否定。每种策略分别作用于 0、1、2、3 条检索段落,组合形成 588 次实验,在 FEVER 构建的事实核查任务上测评。结果显示,准确率从干净上下文的 77.9% 降至全部三段被毒化时的 43.5%。实体替换导致正确答案翻转最多;数字替换在少数毒化段落时影响平稳,成为多数时准确率骤降。模型大多选择不回答,而非生成新错误,基于词汇重叠的未支持生成指标在攻击下下降而非上升。本文属于小规模测量,标签自动化粗糙,结论仅作初步指示,需在解码控制和更严格判定下进一步验证。
点评