NeFut Logo NeFut
EN 管理员登录

[AI学术] 更倾向于拒绝,而非更具辨别力:预执行 LLM 监督中的验证单元

发布于:2026-08-26 22:00 最后更新:2026-08-29 12:04
#AI #Machine Learning #LLM

预执行监督是 AI 控制中可信监控的核心:一个可能出错的 LLM 监视器在不可逆执行前审查计划动作。过度阻断会削弱实用性并迫使部署者关闭监督。每种协议都必须明确验证单元——一次调用审查多少动作。现有设计默认该单元,却未衡量其对易错监视器的影响。自然产生的轨迹无法单独分离单元效应,因为审查长度与错误类型和位置共变。仅看拦截率会误导:全拦截看似捕获全部错误。为仅测量单元效应,需要仅变动边界并配对干净对照。我们提出双前缀框架,提供这两者。每个金计划生成一个前缀,注入一个环境可接受的错误,以及一个仅在一次写入上不同的干净双胞胎。对每对前缀在五个嵌套长度上进行判断,将判决变化仅归因于单元本身。辨别力通过预注册的知情度(informedness)衡量,即拦截率减去误拒率。更长的审查提升拦截率,但误拒率同步上升。所有六位评审在两个领域的结果均显示,知情度在审查 1~2 个动作时达到峰值:更长的窗口让零样本监视器更倾向于拒绝,而非更具辨别力。回放被遮蔽的观测表明,主要失效原因是观测缺失。安全案例应声明所用单元并共同报告干净序列。我们的框架是首个受控、预注册的度量工具,且从不单独读取拦截率。校准后的短单元在八动作审查中可恢复最高 0.95 的知情度,且没有测试过的标签盲策略能够持续超越它。

博主点评:该研究揭示了监督窗口长度对 LLM 监控行为的关键影响,提供了可复现的实验框架,对构建更可靠的 AI 安全机制具有重要参考价值。

原文链接: https://arxiv.org/abs/2608.23941

[h] 返回首页