基准评分常由 LLM 判官完成,能够区分十分之一分的差异,但其分辨率从未被量化。已有的样本复杂度研究只覆盖准确率基准,未涉及判官情形。我们把 373,019 条判决视作被测系统,使用广义可测度理论将其分解为系统、条目、判官和交互四个成分。核心结构性发现是:在单一判官下,系统的可测度趋向 $$\frac{\sigma^2_s}{\sigma^2_s+\sigma^2_{sj}}$$,与条目数量无关,因为系统‑判官项不含 $n_i@@@MATH_BLOCK2@@@\sigma^2{sj}$ 下降两个数量级,天花板提升至 0.986(bootstrap [0.934, 1.000],基于 11 个系统),因此单判官已足够。配对方式带来新问题:系统若先呈现,其获胜概率比后呈现高 8.6% ,这相当于已发表的 53 项胜率比较中位提升的 1.23 倍。实验表明,协议设计对结果影响大于面板规模。实际测得的下限在 0‑5 分尺度上为 0.41‑1.24 分,而文献报告的中位提升仅为 0.28 分;在唯一可完全匹配的基准上,17 项 MT‑Bench 改进全部低于 MT‑Bench 自身的下限,70% 的胜率声明低于配对下限。对 628 篇 arXiv 论文的审计(两独立模型双重编码并与盲测人工编码对照,kappa=0.73)显示,只有不到四分之一的论文说明其评估是否重复运行,且仅有 46‑67% 报告任何形式的不确定性。
点评