可靠的智能体评估面临自动 harness 优化的挑战。该过程会反复使用已发布的基准 $B_{\mathrm{rel}}$,让一个 Proposer 对提示、记忆、检索、工具和控制代码进行编辑,以围绕固定的目标智能体构建 harness。任务保持集(task holdout)仅更换语义任务,却保持基准协议不变,导致“坏天才” Proposer 能够生成依赖基准整体捷径的作弊 harness,使得在已发布基准上的收益并不反映真实能力。\
我们提出 Counterfactual Harness Search and Evolution (CHASE),将 harness 演化视为在保持有效性的基准反事实上生成约束。每次 Proposer 更新后,Challenger 会搜索可执行的协议变换,以产生大幅度的收益破坏。有效性防火墙确保任务语义不被改变,确认集用于判断反事实是否进入有限存档。我们形式化了一个精确的、消除捷径的基准 $B_0$,并给出统计保证:有限的反事实存档能够关联到 $B_0$,并描述 Challenger 的顺序搜索行为。\
实验在合成基准和 OfficeQA 上进行。结果显示,CHASE 在保持已发布基准显著收益的同时,显著降低了在有效协议变更下的收益破坏。\
点评