NeFut Logo NeFut
EN 管理员登录

[AI学术] DriftNet:用于检测和定位LLM代理提示注入的双头轨迹Transformer

发布于:2026-09-13 22:00 最后更新:2026-09-15 01:15
#Machine Learning #LLM #Artificial Intelligence

当间接提示注入成功攻击LLM代理时,攻击痕迹会体现在代理的行为序列中:一个看似正常的工具调用前缀、一段被投毒的观察以及随后为攻击者服务的动作后缀。运维人员需要知道三个信息:攻击从何处进入、哪些步骤被篡改以及表面上的投毒是否被抵御。现有系统要么只给出整条轨迹的安全判定,要么只返回单一的危险索引。我们提出 DriftNet,这是一种双头轨迹Transformer,只需一次前向传播即可同时回答上述三个问题:第一个头判断整条轨迹是否被破坏,第二个头为每一步分配四类标签(正常、注入点、被劫持、注入失败)。该模型是首个能够产生这种联合输出的监督检测器。每一步通过冻结的句子编码器和四个无身份的世界特征进行嵌入,主干网络参数不足两百万,使用加权的联合损失同时优化两头,无需访问代理内部模型。我们在 AgentDrift 基准的任务不重叠划分上进行评估(12,536 条轨迹,71,024 个标注步骤),通过 20 组超参数搜索将敏感度控制在 0.011 F1,测试集仅评估一次。结果显示,DriftNet 在轨迹层面的 F1 达到 0.983,注入点恢复率为 98.7%,被劫持段的 IoU 为 0.979,能够零误报 218 起被抵御的攻击,仅在硬负例上产生 2.9% 的误报。对比表面基线,后者在部分劫持和延迟执行上的恢复率分别只有 11.1% 和 17.1%,而 DriftNet 分别提升至 98.6% 和 93.2%,且所有误报率均更低。对剩余 26 条错误进行人工检查发现,大多数漏检源于注入观察中缺乏可读指令的情况,同时我们报告了基准中测得的世界身份正则性指标。

点评

原文链接: https://arxiv.org/abs/2609.10892

[h] 返回首页