随着大模型在认知密集任务上达到甚至超越人类专家的水平,如何对这些系统进行准确的监督变得尤为紧迫。AI 辩论是一种利用两位强大 AI 互相对抗,将复杂问题拆解为易于直接评判的子命题的思路。已有理论工作把这种直觉形式化为计算复杂度框架,目标是设计辩论协议(即游戏规则),在有限的人类监督下对复杂问题的解答提供严格的正确性保证。
目前最好的协议能够处理所有具备足够稳定的子问题分解的问题。本文提出了一种新的协议,在同一类问题上实现了多项改进:
- 正确性从平均情况提升到最坏情况,即无论对手如何策略,协议仍能保证判定正确。
- 对两位辩手而言,诚实且正确的策略成为占优策略均衡(dominant‑strategy equilibrium),而不是仅在领袖‑追随者结构下成立的 Stackelberg 均衡。
- 通过黑盒下界证明,所提协议在实例层面上是最优的:在仅使用对人类判断的黑盒查询时,没有任何协议能够在同类问题上取得更好的表现。
技术上,本文将稳定问题分解与查询复杂度中的分数块敏感度(fractional block sensitivity)联系起来,记作 $\operatorname{fbs}(f)$,并利用该概念构造协议的查询上限与下界,从而得到实例最优性。
点评:该工作在理论上巩固了 AI 辩论的可靠性,尤其是通过最坏情况保证和占优策略,使得实际部署时对人类监督的依赖更可预测,同时提供了黑盒最优性的强力证据,为后续算法设计提供了清晰的基准。