摘要
LLM 代理通过工具调用在现实环境中执行操作,而一次错误的行动可能会造成不可逆转的伤害。传统的安全防护措施是一个守护模型,它将每个提议的行动标记为安全或不安全,但这种二元视角混淆了两个不同的决策:该行动本身是否有害,以及在特定用户上下文中是否合适。
它还在动作类别的粒度上操作,而非单个实例,导致常规干扰削弱了用户的自主性,并训练用户忽视最重要的警报。
我们将问题重新定义为对 {EXECUTE, ASK, REFUSE} 的每个实例进行三向路由决策,并通过安全哨兵(Safety Sentry)实现了这一点,这是一种轻量级的守护模型,其推理简化为单次解码调用。
通过设置单一解码时间阈值,可以在不同风险容忍度的部署中重新定位一个固定的检查点,而无需重新训练。安全哨兵在整体准确性和安全相关召回率上超越了一系列开放权重和前沿闭源基线,同时控制方向性错误率。
博主点评: 安全哨兵通过引入上下文感知的三向路由决策,显著提升了 LLM 的操作安全性。这种方法不仅减少了不必要的干扰,还提高了系统的灵活性和适应性,展现了在风险管理中的新思路,值得深入研究和应用。