检索增强生成(RAG)通过将大型语言模型的输出与外部知识库对齐,提升了答案的准确性和可信度。但这种依赖也为投毒攻击提供了入口。本文提出 微协作投毒(Micro-Collaborative Poisoning),其核心思路是将一个虚假的目标陈述拆分到多篇看似合理的文档中,而不是集中在单一的恶意段落里。
我们在 108 种 RAG 配置下进行评估,分别变更了数据集、检索器架构、检索深度、数据库组成、被投毒的数据库数量以及生成模型。实验表明,微协作投毒的成功并非依赖单一的强毒段落,而是依赖于多个弱对抗信号在检索结果中的累计效应。提升 top-$k$ 检索深度或对多个数据库同时投毒,会增加这些弱信号共同出现的概率;而增加干净数据库的多样性或使用更强的检索器,则能显著削弱其影响。
进一步的文档层面可视化分析显示,单独检查文档难以发现微协作投毒,因为它在保持较低显式投毒特征的同时,仍能对下游生成产生显著影响。这使得该威胁在实际部署中更难被检测和防御。
点评:微协作投毒揭示了 RAG 系统在多源信息融合时的潜在安全盲点,提示研究者在构建检索库和选择检索策略时,需要综合考虑信息多样性与对抗鲁棒性。