在长时间运行的自主代理中,代理会在没有人类干预的情况下进行计划、行动和判断自己的完成度。当代理自我评估其工作时,自我评估偏差可能会出现:似是而非的变化被视为进步,而现实世界的结果却停滞或退步。我们将这种失败模式称为“进步幻影”,并通过控制测量展示了评估者的基础是什么。
我们构建了一个测试平台,固定代理及其工具表面,仅操控评估者的信息通道类型。一个世界状态的oracle,原则上不可伪造,通过容器和网络隔离强加,并在每次运行时进行验证。在54个周期中,一个前沿代理每次都声称有所改善,但56%的测量结果显示变化为零或以下。因此,自我报告并没有提供有用信息,自我裁决的门户退化为“全接受”,使其最佳部署状态下降了19%。
即使是最强的带内评审者,阅读完整的文档文本、变化差异和自身裁决历史,也接受了44%的真实世界回退周期,并拒绝了38%的真实改善;预注册的对抗假设认为强评审者能缩小差距,但被否定。
在一个成功规格可从文档本身验证的边界任务中,同一评审者的幻影消失为零,差距在注册阈值内收敛,显示出差距依赖于成功信号的位置。返回仅接受裁决的标志变体保持了与完整反馈相似的现实输出(110.0对113.0),将收益定位于门户的基础,而非反馈内容。对于成功信号位于文稿之外的开放式目标,仅仅扩大评审者的规模是不够的;进行真实世界访问的带外评估是结构上的必要条件。
博主点评: 本文揭示了自主代理在自我评估中常见的偏差,尤其是在长时间运行的情况下,如何导致对进步的误判。通过控制实验,作者清晰地阐明了评估者基础对结果的重要性,为未来的自主系统设计提供了重要的启示。特别是,在处理开放式目标时,强调了真实世界反馈的必要性,这为进一步研究提供了方向。