NeFut Logo NeFut
EN 管理员登录

[AI学术] ChainWatch:多步骤攻击检测的前沿框架

发布于:2026-07-24 22:00 最后更新:2026-07-26 07:44
#AI #Open Source #Security

摘要

模型上下文协议(MCP)是一个开源标准,允许AI代理连接到外部工具、数据库和服务。尽管这种连接增强了代理的能力,但也引入了现有逐调用防御无法可靠检测的多步骤攻击。攻击者能够将单独良性的工具调用组合成恶意序列,从而避开孤立的检查。

本文提出了ChainWatch,一个用于识别MCP基础AI代理系统中多步骤攻击的顺序检测框架。ChainWatch通过六阶段杀伤链模型化攻击进展,并应用隐马尔可夫模型(HMM)对工具调用序列进行分类。当会话在多个阶段中表现出可疑进展时,将触发检测规则。该框架支持一个结构化的威胁模型,涵盖了直接顺序攻击、间接提示注入链以及混合多阶段攻击。

一个20维特征提取方案捕获工具交互中的行为信号。我们使用来自安全文献的五个代表性攻击场景展示了该方法,表明ChainWatch能够检测那些规避传统逐调用安全机制的攻击链。

博主点评: ChainWatch通过将攻击建模为多阶段进程,结合HMM分类,显著提升了对复杂攻击的检测能力。这种方法为AI代理的安全防护提供了新的思路,尤其在面对不断演化的威胁时,展示了强大的适应性与准确性。

原文链接: https://arxiv.org/abs/2607.19432

[h] 返回首页