可扩展监督旨在验证能力超出监督者的智能体行为。AI 辩论被提出作为一种监督方案,让竞争的智能体帮助资源受限的验证者评估其单独无法可靠判断的主张。其核心假设是通过激励诚实论证来获得正确裁决。然而,正确的裁决并不唯一决定支撑它的论证过程。智能体仍可自行决定呈现哪些正确的主张、如何表述以及披露的顺序。这种剩余自由使得智能体能够在不影响裁决正确性的前提下,引导验证者学习超出任务本身的信息,从而追求潜在目标。为研究此现象,我们提出了 战略交互监督 (SIO) 框架,将监督视为验证机制与战略通信渠道的统一体。在该框架下,我们形式化了 任务可接受的潜在优化 概念,即在保持规定任务表现的同时追求潜在目标。作为概念验证,我们在已有的带交叉审问的辩论协议中实例化 SIO,并量化了任务成功率与隐藏变量信息披露之间的权衡。该权衡揭示了一个 战略窗口:在此窗口内,仍可大量披露信息而不违背任务可接受性。为缓解此问题,我们通过扩展交叉审问者的角色,在有限交互时域内降低持续披露的偏差。我们的结果表明,评估监督体系时不仅要关注裁决的正确性,还必须审视对话记录中传递的信息量。
点评