NeFut Logo NeFut
EN 管理员登录

[AI学术] 向量数据库中的隐私检索:Shadow Queries 方法

发布于:2026-09-07 22:00 最后更新:2026-09-08 00:37
#AI #Machine Learning #LLM

大语言模型越来越依赖检索增强生成(RAG)等信息检索系统,将领域知识通过向量数据库引入而无需重新训练。

向量数据库通常存储预计算的文档嵌入,但这些嵌入易受嵌入逆向攻击(EIA),攻击者可以从嵌入恢复原始文本。现有防御如添加噪声或缩放嵌入,要么隐私提升有限,要么检索效果大幅下降。

本文提出 SHAQ(Shadow Query Generation),一种基于语义分解和嵌入解耦的防御。核心思路是攻击依赖嵌入与原文的强耦合。SHAQ 不直接存储文档嵌入,而是使用生成式语言模型为每篇文档生成多样的 shadow query,捕获文档的不同语义侧面。随后对这些查询进行编码并存入向量库,实现语义分解和嵌入解耦。

实验在多个公开 IR 数据集上进行。结果显示 SHAQ 将恢复率降至 0.2104,较基线防御多保护 19.50% 的 token,同时在 MAP@10 上达到 0.7967,甚至提升检索效用 5.53%。这些数据表明语义分解与嵌入解耦是防御 EIA 的有效替代方案。

综上,SHAQ 通过生成多样的 shadow query 替代原始嵌入,在保持检索性能的前提下显著提升隐私安全,为向量数据库的安全使用提供了新思路。

点评

原文链接: https://arxiv.org/abs/2609.04767

[h] 返回首页