摘要
现有的大语言模型代理的防护系统作为二元分类器,主要任务是屏蔽不安全内容,导致组织不得不丢弃失败的输出并从头开始重试。我们引入了 RAIL Guard,一个闭环的负责 AI 流程,通过对 LLM 输出进行八个可测量维度的评估,并通过评估-重写-再评估循环迭代修复失败的输出。
我们在四个前沿 LLM 和 4,276 个内容输出及 6,400 个代理工具调用场景上进行了三项实验,以评估该流程。闭环修复的收敛率达到 96.9%,而阻塞重试的收敛率仅为 49.1%;尽管收敛率最高的方法降低了 22.3% 的效用,但基于反馈的自我修复在可修复维度上达到了 86.6% 的收敛率且没有显著的效用损失(p = 0.177)。
预工具调用评估将不安全的代理执行减少了 33%(p = 0.007),且对任务完成没有影响。我们识别出可修复维度与结构维度之间的关键区别,后者需要架构而非算法解决方案(透明度 93.0%,问责制 92.8%,包容性 82.5% 的失败率)。该系统以开源 SDK 的形式提供。
博主点评: RAIL Guard 的闭环修复机制显著提升了 LLM 的安全性与可靠性,尤其在面对不安全内容时的表现。其开源特性也为社区提供了极大的便利,推动了负责 AI 的发展。通过对可修复与结构性维度的深入分析,为未来的 AI 系统设计提供了重要的参考。