NeFut Logo NeFut
EN 管理员登录

[AI学术] 只问Jev:用于校准决策的强化学习作为AI对齐失败的零样本检测器

发布于:2026-09-25 22:00 最后更新:2026-09-28 00:49
#Machine Learning #LLM #Artificial Intelligence

检测对齐失败的工具用于筛选已部署的语言模型并对对齐基准进行打分。大多数方法是生成式评审,需要对每个准则进行一次解码;还有读取 token 概率的分类器(如 Llama Guard),但每次调用只能输出一个固定标签。Jev 是一种通过强化学习进行校准决策(RLCD)训练的模型,它能够在一次调用中对同一输入的多个类型问题给出校准概率。我们尚未测量它在检测对齐失败方面的表现。为此我们构建了 RLCDAlignBench,对 Jev 在十类对齐失败上进行基准测试:阿谀奉承、越狱、欺骗、提示注入、幻觉、隐私泄露、社会偏见、奖励黑客、隐藏不确定性以及权力追求。该基准覆盖 44 项测试和五个目标模型,由每个基准的评分器标注,另外两项由人工标注。许多失败是相对的,需要相对于用户信念或注入指令等参考来定义,仅凭响应本身无法判断。我们的核心思路是将 Jev 被问的问题与它看到的内容分离:一侧是问题的措辞和答案类型,另一侧是输入的字段。单一通用问题在零样本设置下实现了 0.886 的中位 AUROC,并在多数基准上超越监督基线。问题措辞影响不大,输入上下文影响更显著,主要通过包含标签信息的字段实现。Jev 与参考评分器对人工标签的吻合度相当,揭示了现有基准的标签缺陷,且成本比 LLM‑judge 评分器低 63 倍。代码与数据已开源:https://github.com/sumleo/RLCDAlignBench。

点评:该工作展示了通过 RLCD 训练的模型在多任务零样本检测对齐失败方面的潜力,提供了高效且可解释的评估手段,对未来对齐安全研究具有重要参考价值。

原文链接: https://arxiv.org/abs/2609.29429

[h] 返回首页