NeFut Logo NeFut
EN 管理员登录

[AI学术] RAG-CT:通过扫描提示分布缓解检索增强生成系统的隐私风险

发布于:2026-09-17 22:00 最后更新:2026-09-18 00:46
#AI #Machine Learning #LLM

检索增强生成(RAG)通过让大语言模型(LLM)在外部知识库上检索后再生成答案,显著降低了幻觉和事实错误。然而,攻击者可以构造恶意查询,使检索过程泄露个人可识别信息(PII)。为此我们提出 RAG-CT,一种基于查询熵值和边际分布的轻量检测方法。RAG-CT 首先计算每个查询的熵,以衡量检索结果的不确定性;随后评估检索得分的边际差距,捕捉异常的高置信度返回。两者结合形成评分函数,若超过阈值即标记为恶意。我们在两套公开数据集上分别对四种最新攻击手段和四种已有防御基线进行评估,实验表明 RAG-CT 能在保持生成质量的同时显著降低 PII 泄露率,且无需改动底层 LLM 或检索器。

点评

原文链接: https://arxiv.org/abs/2609.16095

[h] 返回首页