摘要
传统的渗透测试在每一步中都使用侦察来发现未被察觉的弱点、构建更强的攻击并推进目标;我们主张AI代理也需要这种处理。我们通过建模过程来形式化代理侦察,并识别其寻求提取的知识资产:它们是什么,如何使用,以及利用哪些代理弱点为对手在间接提示注入攻击中提供杠杆。
我们在此基础上提出了“了解你的代理”(Know Your Agent, KYA)框架,该框架通过探测代理、构建目标档案并利用这些档案来设计更强的攻击,从而自动化黑箱的基于侦察的渗透测试。
我们在代理安全基准和一个真实的编码代理上评估了KYA,并发布了KYA、其基准和基线实现,确保可重复性。
博主点评: 该研究为AI代理的安全性提供了新的视角,通过侦察驱动的渗透测试框架,能够有效识别并利用潜在的安全漏洞。在当前AI技术迅猛发展的背景下,这一方法显得尤为重要,有助于提升AI系统的安全防护能力。