摘要
近期的自主渗透测试论文在添加多组件安全结构后报告了高基准分数。然而,由于这些系统常常改变架构和基础模型,因此很难判断性能的提升是来自安全结构还是底层模型。本文在104任务的XBOW基准上进行了一项控制研究,使用默认编码CLI代理作为基线。
我们首先在相同的GPT-5模型、预算、目标接口和评分规则下运行Codex、OpenCode和Pi。这一阶段旨在识别最强的相同模型基线,并测试安全特定的提示变体是否能改善其观察得分。接着,我们将默认Codex框架与已发布的MAPTA和PentestGPT V2结果进行比较,以找到最接近的模型匹配。最后,我们使用GPT-5.2和GPT-5.5重复了平面代理实验,以测量在相同框架内的模型扩展。
结果显示出混合但实用的情况。专门的安全结构可以提供可测量的基准提升,并可能提高成本效率,但普通编码代理已经解决了基准的大部分问题;重复的普通代理运行可以在联合覆盖中匹配或超过一些已发布架构的分数,而更新的模型在相同框架内显著提升表现。未来的评估应在将基准提升归因于架构设计之前,报告模型匹配的普通代理基线。
博主点评: 这项研究强调了在评估技术性能时,基线的重要性。通过对比不同模型的表现,研究者能够更清晰地识别出哪些提升是由于架构设计而非模型本身的优化,推动了自主渗透测试领域的深入理解。尤其是普通编码代理的潜力,值得进一步探索。