NeFut Logo NeFut
EN 管理员登录

[AI学术] 潜行分离,危害共生:基于技能的代理系统的级联攻击

发布于:2026-09-28 22:00 最后更新:2026-09-30 01:41
#AI #Machine Learning #LLM

技能是由自然语言指令、可执行脚本和参考资源组成的模块化包,代理在运行时加载以完成特定任务。技能化代理系统因此能够灵活复用第三方能力,但同样暴露出新的攻击面。此前研究主要关注单个技能内部的漏洞,跨技能交互带来的风险却少有关注。

我们提出技能级联攻击的威胁模型:恶意目标被拆分到多个技能中,每个技能的修改单独看似无害,但组合执行时会产生危害。例如在处方审查流水线中,第一技能削弱已停用药物的信号,第二技能降低与这些药物相关的相互作用严重度,第三技能在最终摘要中抑制低优先级警报,导致严重药物相互作用警告在医生看到之前被静默消除。

为系统化研究这一安全盲点,我们构建了 SkillCascade——一个自动化多代理红队框架,并发布了 SkillCascade-Bench 基准,收录 213 条经验证的级联测试用例,覆盖多个代理系统和任务域。

在代表性代理(如 OpenClaw、Claude Code、Codex)以及不同 LLM 骨干上进行实验,级联交互能够可靠触发有害行为,同时规避现有的单技能扫描器和运行时监控。

实验结果凸显了组件层完整性与系统层安全之间的鸿沟,呼吁研发能够对跨技能交互进行推理的防御机制,而非仅针对孤立技能进行检测。

点评

原文链接: https://arxiv.org/abs/2609.30383

[h] 返回首页