NeFut Logo NeFut
EN 管理员登录

[AI学术] 清洁工程,测量不稳:黑盒 LLM 观察者在共享端点上的预注册可靠性失效

发布于:2026-09-05 22:00 最后更新:2026-09-06 01:02
#AI #Machine Learning #LLM

语言模型评审(judge)如今负责过滤训练数据、为生成内容打分并驱动排行榜。评审本身成为一种测量工具,而该工具隐含的唯一假设是:同一请求发送到同一模型名称,第二天仍会得到相同的输出。我们在两次预注册实验中审计了这一假设,所有阈值均在实验前固定;结果表明仪器根本未通过验证。

在 52,988 次请求审计中,同窗口的重复排名的 Spearman 相关系数仅为 0.400,远低于预设的 0.90;而字节完全相同的次日重放的相关系数为 0.78,低于要求的 0.99,且每次的执行记录均已达上限。导致差距的三大机制为:

  1. 标签‑意义映射导致读数偏差与信号同等强度;
  2. 候选差距比仪器噪声底部低七个数量级;
  3. 完全相同的输入在不同时间返回不同排名,这种噪声在精确排列的读数中会被放大。

在测试网格上,替换度量或重新抽样均未能修复问题。后续的预注册实验进一步界定了问题范围:

我们将证据提炼为三层快照‑身份阶梯、八条设计规则以及一份报告清单;若在研究调用量的约 2% 进行试点,就能提前发现这两个不可达的门槛。所有结论均基于共享服务基础设施上的外部行为测量。结论是:在共享端点上,模型名称并非冻结的仪器;任何预注册评估必须先测量其仪器特性,再对其设定门槛。

点评

原文链接: https://arxiv.org/abs/2609.04198

[h] 返回首页