NeFut Logo NeFut
EN 管理员登录

[AI学术] ObserverBench:评估干预与控制的机制估计

发布于:2026-09-05 22:00 最后更新:2026-09-06 01:02
#algorithm #AI #Machine Learning

Mechanistic interpretability 正在被用于指导激活引导、回路移除和安全监控等干预。即便内部估计在平均意义上准确,也可能导致糟糕的行动选择。为此我们提出 ObserverBench——一个用于检验内部估计器(观察者)是否适用于其指引的干预、控制或安全任务的基准框架。每个任务固定模型、信息边界、允许的行动、决策规则、留出案例以及损失函数。基准分别报告估计精度和所选行动导致的损失,两者缺一不可。理论分析表明,在闭环控制中,观察者误差在起始点以及允许干预可达的方向上都会产生影响。实验在 GPT-2‑small 与 Qwen2.5‑7B 上的回路干预任务中显示,成对观察者能够更准确预测未见效应,却不一定总是选择更好的行动;基于行动损失训练的观察者能够选出更低损失的行动。安全分流任务中,即使一个得分能够完美区分违规,若违规的成本不同,固定预算的分配仍可能不佳。跨模型的 APPS 任务表明,AUROC 能够对监控器进行排序,但与部署损失的排名不一定一致,最佳信息源随模型而变。稀疏 SAE 读取在报告的 Qwen 面板上落后于同层密集基线,原因在于激活稀疏度或检查点不匹配。ObserverBench 提供固定任务合约、可运行基线以及基于表格的提交方式,以通过实际行动评估可解释性方法。

点评

原文链接: https://arxiv.org/abs/2609.03026

[h] 返回首页