NeFut Logo NeFut
EN 管理员登录

[AI学术] 基于联邦图学习的LLM多代理系统隐私保护拓扑安全

发布于:2026-09-05 22:00 最后更新:2026-09-06 01:02
#AI #Graph #LLM

LLM 多代理系统需要在通信图上定位风险代理并对拓扑进行干预。传统做法假设单一运营商能够收集所有标记的交互轨迹,但在跨组织场景下,提示、工具输出和工作流均为私有,单个孤岛无法看到完整的攻击分布。

我们将此安全防护问题建模为图联邦学习,并实现了 FGLGuard。每个运营商在本地使用带边特征的图注意力检测器对其判官标记的 episode 图进行训练,只共享模型更新而不泄露原始数据。

核心技术包括:针对非 IID 客户端的近端本地目标、域平衡聚合、过拒绝约束的阈值校准、上游评分的相互验证以及对被阻断答案的受保护重写。

在 AgentSafetyBench、R‑Judge 和 AgentDojo 三大基准上,联邦 FGLGuard 在不聚合任何数据的前提下,AUROC 超过了同域中心化的上限,远超无监督异常检测和仅本地训练的方案。跨四个不同领域的运营商联邦时,AUROC 与多域中心化仅相差 0.03,而单域守护在其他领域几乎失效。实时部署的 FGLGuard 将 AgentDojo 的真实攻击成功率降低 43%,几乎不影响系统效用,API 成本为零,能力损失可忽略。

实验表明,联邦学习不是可选项:离线迁移在分布漂移下 AUROC 仅从 0.51 提升至 0.70,必须在每个站点的私有轨迹上自适应才能提供可靠防护。

点评:FGLGuard 展示了在保持数据隐私的前提下,通过图联邦学习实现跨组织安全协同的可行路径,为 LLM 多代理系统的实际部署提供了强有力的技术支撑。

原文链接: https://arxiv.org/abs/2609.02967

[h] 返回首页