我们提出了nsfaguard,这是一个用于保护自主AI系统免受操作威胁的安全框架,包括提示注入、敏感信息提取、恶意代码请求、危险工具误用和资源耗尽等问题。首先,我们介绍了NSFA分类法,将185种风险变体组织成基于CIA三元组的层次结构,并与三条成熟的OWASP指南进行了交叉验证。在此分类法的基础上,我们构建了一个基准套件,涵盖133种语言,包含超过93K个针对用户查询和代理响应的专用样本,以及从五个公共代理安全数据集中改编的3,435个跨源样本。为了在实践中检测这些操作威胁,我们开发了一种双模式方法,结合了基于SFT的生成推理用于可解释的离线审计,以及在冻结骨干网络上的判别分类头,实现了约50毫秒的实时检测。我们发布了四个模型,参数分别为0.8B、2B、4B和9B,均在专用基准上获得了≥94%的F1分数,并超越了最强竞争对手6到12个绝对点。在跨源评估中,9B模型取得了91.29%的F1,且精确度与召回率的平衡表现更佳。此外,消融实验表明,分类头可以为防护措施提供超出其原始范围的风险检测能力,并达到最先进的性能。这些结果展示了该方法的可扩展性及其作为插件增强的通用性。
博主点评: 该研究提出了一种创新的防护框架,显著提高了自主AI系统对多种操作威胁的抵御能力。通过整合生成推理与实时分类,显著提升了安全性和可解释性,展现了其广泛适用性与未来的应用潜力。