随着大语言模型(LLM)代理承担越来越复杂、跨越更长时间跨度的任务,验证它们的输出变得愈发困难。本文研究在仅使用固定基模型、且在测试时无法获得参考答案或评分标准的情况下,如何提升验证能力。通过重复采样可以得到多条执行轨迹(rollout),其中可能包含互补的正确陈述,但需要可靠的验证机制来判断哪些陈述可信。研究发现,模型之间的分歧往往揭示正确的备选方案,而一致性有时会掩盖错误。基于此,提出 VeriHarness:将生成器底层的 LLM 通过提供工作空间、证据工具和可复用的验证技能,转化为代理式验证器。系统包括分歧解析器,用环境证据检查相互竞争的陈述;共识挑战器,对共享的陈述进行测试并搜索遗漏的需求。它们的结果用于挑选并修订最终产出。实验在五个长时工作空间基准和两种前沿模型上进行,VeriHarness 在所有基线中获得最高的选择分数。基于证据的修订进一步提升平均性能,对 Gemini 3.5 Flash 提升 6.2 分,对 Claude Opus 4.8 提升 6.4 分。进一步实验表明,验证技能可以通过失败反馈自我改进,验证了 VeriHarness 作为扩展长时代理验证的关键方法。我们公开了约 26,000 条 rollouts(覆盖全部五个基准和两种模型),总成本超过 10 万美元,以支持后续的代理验证研究。
点评