NeFut Logo NeFut
EN 管理员登录

[AI学术] PlanFlip:多智能体LLM系统中的规划阶段提示注入攻击

发布于:2026-07-21 22:00 最后更新:2026-07-22 01:01
#AI #Machine Learning #optimization

摘要

多智能体LLM系统日益依赖规划器将目标分解为子任务序列,由下游执行者和评审者执行和审核。我们识别出规划阶段作为一个关键攻击面:单次注入到规划器的上下文中即可实现级联放大,腐蚀所有下游子任务。我们介绍了PlanFlip,这是一个包含四种规划阶段提示注入攻击的框架——GoalSubstitution (PF-1)、PriorityInversion (PF-2)、ContextPollution (PF-3) 和 RoleConfusion (PF-4),每种攻击都伪装成合理的工具输出,以规避关键词过滤。

在对九个前沿LLM进行3,479次实验评估后,我们发现了三点:

  1. 能力放大脆弱性——GPT-5的攻击成功率最高(ASR = 0.68),与“更强模型本质上更安全”的假设相矛盾;
  2. 同质管道表现出相关代理的盲点——GPT-4o和Llama-3.3-70B的ASR接近0,但Stealth = 1.00和StepShift = 0,攻击在重组计划的同时,同一骨干的评审者报告一致性(两位独立评审确认语义偏差为-0.20至-0.32,r = 0.943);
  3. 增强推理的模型抵抗注入——DeepSeek-R1在所有攻击中实现StepShift = 0.00。

我们提出GoalAnchorCheck (D1) 和 CrossAgentConsensus (D2),检测率高达1.00,并在16个单元中的15个中优于同骨干基线。我们的关键见解是:异构模型多样性是多智能体系统的安全前提;同质骨干中的冗余无法抵御规划阶段的攻击。

博主点评: 这项研究揭示了多智能体LLM系统在规划阶段的脆弱性,特别是强模型并不总是更安全的观点。通过引入多样性,可以显著提升系统的安全性,这是未来设计多智能体系统的重要考虑因素。

原文链接: https://arxiv.org/abs/2607.16199

[h] 返回首页