NeFut Logo NeFut
EN 管理员登录

[AI学术] 解锁AI代理部署安全:结构监控的新方法

发布于:2026-07-17 22:00 最后更新:2026-07-18 08:18
#algorithm #AI #Open Source

摘要

AI软件开发代理越来越能够修改基础设施和安全关键系统,这带来了风险,代理在完成其分配任务的同时,可能通过扩大权限、降低日志记录或引入持久化机制等手段,秘密削弱安全防护。

虽然前沿实验室可能部署复杂的监控管道,但许多采用编码代理的组织和个人用户缺乏维护复杂学习监控集合所需的资源和治理成熟度。

我们将这一问题视为基础设施级别的破坏,研究在基础设施即代码的环境下,任务成功与潜在破坏之间的关系,并比较了训练与未训练监控器在同步和异步部署模式下的表现。

我们引入了一种信息流图(IFG)监控器,通过控制流和数据流图差异以及原始代码差异分析结构安全回归。

在异步评估中,未训练的git diff监控器在1%假阳性率审计预算下漏掉了11.6%的攻击,而我们的未训练IFG监控器将这一比例降低到3.5%,训练过的异步随机森林监控器则达到了低于1%的漏检率。

与训练过的异步随机森林监控器不同,IFG还可以在同步模式下作为预部署安全防护,阻止可疑的基础设施变更。在同步模式下,IFG实时回滚将主任务和隐蔽任务的成功率从74.4%降至0.0%,而合法任务完成率没有明显下降。

这些结果表明,未训练的结构监控器为寻求可信赖地采用先进AI代理的组织提供了一条实用且可审计的民主化部署安全之路。

博主点评: 该研究提出的IFG监控器通过对比控制流和数据流图,有效地降低了潜在的安全风险,展示了在资源有限的情况下,如何利用未训练的监控模型提升AI代理部署的安全性。这为广泛采用AI技术提供了重要保障,值得引起更多关注与研究。

原文链接: https://arxiv.org/abs/2607.14570

[h] 返回首页