在高影响力操作日益频繁执行的背景下,运行时安全监控显得尤为重要。我们提出了 NEXUS(Neural EXecution Utility and Safety),这是一种结构化计划安全监控工具,采用正式的干预策略,从四种操作中进行选择:允许、阻止、请求确认或请求修订。
NEXUS结合了确定性的安全规则、论据级别的检查以及经过校准的逻辑回归风险评分,以实现分级升级。在一个包含128个实例的合成基准测试中,NEXUS达到了0.949的F1分数和0.6406的四类干预准确率,超过了仅依赖规则的干预选择,提升幅度为27.3个百分点。它在R-Judge上也表现优异(F1 = 0.861对比0.849),在AgentHarm上由于威胁模型的限制与规则方法持平,并在IPI上以99%的控制允许率实现了0%的ASR。在规则盲的NEXUS-Stress基准上,NEXUS达到了0.881的F1分数,突显了细粒度干预路由的挑战。NEXUS的中位延迟为0.205毫秒,给典型代理循环增加的开销不足0.1%。代码、基准测试和经过校准的风险评分器均已公开发布。
博主点评: NEXUS的设计充分考虑了工具使用LLM代理的安全性,通过结合多种干预策略和风险评估方法,显著提升了干预的准确性和实时反应能力。这一进展不仅为LLM的安全应用提供了有力支持,也为未来的研究奠定了基础。其低延迟和小开销的特性,展示了在高效执行与安全监控之间的良好平衡。