在重复抽样评估中,pass@k 常被外推到远超每题采样数 $n$ 的范围。我们在池化/随机任务的条件二项模型下证明,固定 $n$ 的成功计数只能识别潜在每任务成功分布的 $n$ 个自由矩。因此,直接的 pass@k 仅在 $k \le n$ 时可被唯一确定,即使在相同 rollout 预算下拥有任意多可交换任务,这一结论仍然成立。这比传统估计在 $n$ 之外未定义的现象更强,因为它明确了固定深度计数实验缺失的信息。
我们给出保持计数律的精确构造,展示了在相同数据下可能出现互不兼容的外推,并指出唯一扩展的例外情形。通过 Hausdorff 主表示,我们计算出锐利的总体可识别区间。
在 Brown 等人公开的每题 10,000 rollout 数据集上,若采用反事实 $n=16$ 的评估,在 $k=1000$ 时的失败率不确定性在四个 MATH/GSM8K/CodeContests 配置中跨越 $1.5$ 到 $2600$ 倍。校准结果表明,仅凭中等规模的失败比例不足以决定区间宽度。
我们的结论并不否定参数化推理时的尺度律,而是提供了一个非参数基准,以检验这些假设。我们还给出了一种精确、保守的单坐标有限任务置信证书以及报告标准,区分直接估计、可识别集合和模型条件预测。
点评