NeFut Logo NeFut
EN 管理员登录

[AI学术] 当优化变为操控:防御生成式搜索的恶意生成引擎优化

发布于:2026-09-05 22:00 最后更新:2026-09-06 01:02
#AI #optimization #LLM

本文聚焦于如何防御生成式搜索引擎遭受恶意生成引擎优化(GEO)攻击。GEO 通过改写网页内容,使其更符合搜索引擎的引用偏好,从而在生成答案时被优先采纳。近年来,GEO 已从手工改写演进到自动化、具备代理能力的优化,显著提升了目标文档在答案中的出现频率。

防御面临两大难题:一是改写后的文档在事实层面仍与原文一致,使得事实核查和困惑度过滤失效;二是这些文档放大的特征同样出现在高质量的良性内容中,难以区分。

为克服上述限制,本文提出 GEO Defender,这是一种与攻击链对齐的两阶段防御方案,且无需对目标大语言模型进行微调。第一阶段 Shield Reranker 在冻结的基础重排序器上学习基于偏好的防御残差,能够在保持相关性判断的同时降低 GEO 改写文档的排名。第二阶段 Training‑Free Shield Generation(TFSG)将防御结果蒸馏为自然语言经验库,在推理时引导目标模型的来源使用。

实验在两款最先进的闭源大模型和三款开源大模型上,针对七种 GEO 攻击进行评估。结果显示,GEO Defender 将平均攻击成功率从 50.32% 降至 6.20%,同时保留了 94.12% 的良性证据使用,答案质量未受显著影响,并能对未见过的攻击构造实例实现泛化。

点评

原文链接: https://arxiv.org/abs/2609.02964

[h] 返回首页