NeFut Logo NeFut
EN 管理员登录

[AI学术] 革命性的LLM安全框架:双假设推理机制的应用

发布于:2026-07-22 22:00 最后更新:2026-07-23 12:33
#AI #Machine Learning #optimization

我们提出了ARBITER,一个新颖的LLM安全框架,包含两个关键思想:(i)双假设推理,这是一种在做出安全决策之前,明确考虑提示的安全与不安全解释的推理方法;(ii)多组件监督微调(MC-SFT),这是一种为基于推理的安全机制设计的结构化训练损失,它将LLM输出分解为逻辑组件,并根据其重要性加权。

现有的基于推理的安全机制通常依赖于昂贵的流程,例如使用更大或闭源的教师模型生成推理轨迹,并进行全参数微调。相比之下,ARBITER采用了一种成本效益高的自生成推理轨迹策略和基于LoRA的参数高效微调,同时在性能上优于这些昂贵的方法。此外,ARBITER为不安全决策提供了可信的证据短语解释,使得安全机制更加透明和可解释。

在三个安全审核基准上的实验表明,ARBITER在超出领域评估中明显优于现有的基于推理和非推理的安全机制基线。

原文链接: https://arxiv.org/abs/2607.17575

[h] 返回首页