重复评估能够在保持复制以认证窄不确定性的前提下,准确估计基准分数。我们在硬预算 $(M+t)K$ 下,对固定网格的 $M$ 项任务、每任务 $L$ 条二进制路径进行建模,假设每条路径最多消耗 $K$ 次响应或回合。对固定 $L \ge 3$ 且 $0<\alpha \le 1/12$,在所有任务均被观测的情况下,最差纯队列的期望区间宽度为 $\Theta_{\alpha,L}\big([M(t+1)]^{-1/2}\big)$;若允许遗漏任务,则宽度为 $\Theta_{\alpha,L}\big([M(t+\sqrt{M})]^{-1/2}\big)$。下界覆盖自适应硬预算策略,而固定随机子集设计通过不一致证书同时达到上述两种速率。联合均值/不一致区间将任务覆盖定律转化为实际的有限预算推断工具。实验证明,在等预算的 LiveCodeBench 回放中,使用 16 种模型、880 项任务、每任务 5 次输出的设置下,任务覆盖设计相较于统一抽样将中位点估计均方误差降低 87.0%,联合证书在 15/16 个面板产生更窄置信区间,并将中位区间宽度缩小 30.6%。有限样本分析表明,在所评估规模下任务覆盖是有效选择,并阐明队列规模与任务内部一致性如何决定有用的操作区间。总体而言,锐利的理论界限与固定预算实证共同将复制与任务覆盖明确为信息高效重复评估的设计变量。
点评