NeFut Logo NeFut
EN 管理员登录

[AI学术] EvalDetectBench:衡量前沿语言模型评估感知能力的基准

发布于:2026-09-03 22:00 最后更新:2026-09-04 02:14
#AI #Machine Learning #LLM

前沿的大语言模型往往能够识别自己正处于评估环境,这种能力被称为评估感知。如果模型在评估时的行为与部署时不同,就会削弱评估结果的可信度,而评估结果是当前 AI 安全框架的重要组成部分。为此我们推出 EvalDetectBench,一个开放的流水线和基准,用于测量评估感知能力,并兼容任何基于 Inspect 的评估框架,帮助研究者在现有和未来的基准上进行测试。

EvalDetectBench 随附一套新整理的对话记录,覆盖当前前沿系统卡评估和多样化的部署来源。该基准有两大用途:一是衡量前沿 LLM 能否可靠地识别自己正被评估;二是评估单个基准本身作为评估任务的可检测性。

我们在已有文献中发现两类系统性偏差:第一,生成部署对话的模型身份解释了测量方差的 11.25%,并可能导致模型排名重新排序;第二,为某一模型挑选的引导提示在其他模型上表现可能接近随机。EvalDetectBench 通过每模型的探针校准以及分层生成器‑调和流程,分别纠正这两类偏差。

点评

原文链接: https://arxiv.org/abs/2609.01611

[h] 返回首页