我们重新审视了对大规模语言模型(LLM)智能体的自动化测试框架演化的评估。现有的测试框架演化方法依赖于单元测试用例来搜索框架配置,并在相同的公共基准上报告最终性能。这种协议引发了两个基本问题。
首先,测试框架演化本身是一个迭代搜索过程,反复评估和修订候选框架,利用任务反馈。因此,它应该与简单的任务级搜索基线进行比较,以确定其增益是来源于改进的框架设计还是仅仅是额外搜索的结果。
其次,由于搜索和最终评估共享相同的基准,报告的增益可能会导致对特定任务集的过拟合。为了解决这些问题,我们进行了广泛的评估,将测试框架演化与简单的测试时间缩放和发现基线进行比较,确保反馈和推理预算相匹配,并在保留任务上评估演化的框架,以评估发现的改进是否具有泛化能力。
在与GPT-5.4和Claude Opus 4.6的Terminal-Bench 2.1上的实验表明,自动化测试框架演化并不总是优于简单的测试时间缩放方法,并且表现出有限的泛化能力。我们的结果提出了关于自动化测试框架演化效果的重要问题,并强调了对自动化框架设计进行更公平的评估协议和基准的需求。我们的代码可在 GitHub 获取。
博主点评: 本文在自动化测试框架演化的评估中提出了重要的思考,尤其是对过拟合和评估协议的关注。虽然自动化演化具有潜力,但实验结果显示其在实际应用中的有效性仍需进一步验证,提示我们在设计和评估智能体时需谨慎对待方法论的选择。