投票聚合多个 LLM 响应是测试时扩容和集成推理的常用手段。增加调用次数可以扩大候选池,从而提升发现正确答案的概率。但在固定调用预算下,已发现的答案仍需在剩余调用中获得足够支持才能成为最终的多数赢家,这形成了发现‑决策差距。\
本文通过已实现的投票状态和剩余预算对该差距进行刻画。我们推导出一个可恢复性阈值 $R^{*}$,并证明在抽样过程中,候选集合只能单向扩张,而可达的终点赢家集合只能单向收缩,这产生了候选层面的转换窗口。在给定 i.i.d. 响应分布的前提下,同一投票状态对应的有限时域终点概率可以精确计算:$$P_{\text{end}}(s)=\prod_{t=1}^{B}\Pr\bigl(\text{vote}_t\mid s\bigr)$$其中 $B$ 为剩余调用预算。\
进一步的理论发现:将错误答案的身份合并不会提升单次调用的正确率,也不能提高多数准确率;错误概率的重新分配效果取决于当前的投票状态。单例可达性提供了一种无需金标的精确锁定证书。对于已知答案空间,锁定的首次触发点是最早的前缀,使得所有合法的后续扩展在固定预算下产生相同输出。\
实验方面,在受控的 Word16 数据集上,我们观察到:\
- 输入排列能够将原始多数准确率提升 $21.1$ 分点,而单次调用正确率几乎不变;\
- 精确锁定在 $16$ 次调用预算下可节省 $28\sim30\%$ 的调用次数,同时保持每一次固定预算的输出不变。\
大多数已发现但未被选中的正确答案在被发现后才失去可达性,这表明发现‑决策转换窗口在实际场景中往往非常窄。\
点评