AI 研究代理需要可靠的实验因果认知,即在受预算限制的实验后能够准确预测各组件的变化对结果的影响。我们提出 WhatWorkedBench,用于衡量这种实验理解能力。代理首先检查代码,然后选择要测量的组件,最后提交一个响应面——即一个表格,预测每种组件配置组合的得分。我们通过穷举 CPU 执行得到参考效应,记录在固定其他组件的情况下单独改变某一组件的影响。该基准覆盖 36 项任务,来源于 30 种数据集和 8 种工作流类型,共计 1248 条配置记录。核心评估使用 4206 条数值控制记录,跨越全部八个家族以及原始六个实验的 108 次代理交互。
在八个新测量点上,配对效应岭回归在 22 个来源中有 15 个达到最优,并将所有效应误差限制在得分范围的 10% 以内(共三项)。对同一代理观测使用高斯过程(GP)拟合,将原始 Flash 队列的效应恢复准确率从 0.632 提升至 0.698,新增队列从 0.621 提升至 0.720。对六个完成的节拍检测和图结构提交,GP 同样提升了家族宏观恢复率,从 0.303 提升至 0.455。针对六个工作流的六个二元选项,在 20 个新测量点上,编码代码等价(行为相同的配置)后,GP 恢复率从 0.248 提升至 0.462。
WhatWorkedBench 为实验代理、适应性实验设计、数值推断以及程序结构利用等研究提供了统一平台。
点评