摘要
安全代理的评估通常在宽松的推理预算下测量其最佳攻击能力,重点关注漏洞发现、利用开发、渗透测试及CTF完成。这些测量虽然有用,但不够全面:在实际安全中,每一步推理、工具调用、遥测查询及丰富请求都消耗预算。
我们通过成本-成功的视角评估语言模型安全代理在攻防Cybench挑战和防御Splunk BOTS v1调查挑战中的表现。与仅报告最佳案例成功不同,我们在固定成本水平下比较模型,并通过推理支出和工具支出来分解性能。
我们的结果显示红队和蓝队任务的不同扩展模式。攻击性CTF表现随着额外测试计算能力的增加而改善,经过扩展的开源模型能够接近前沿的专有系统,同时保持成本竞争力。然而,防御SOC调查的扩展并不以相同方式进行:成功更依赖于工具的有序使用、遥测导航和选择性丰富,而非单纯的推理预算。
我们认为安全代理基准应同时测量经济效率和操作适应性,成本感知的SOC本土评估能够更清晰地呈现出哪些模型在实际应用中有效,以及防御代理仍需改进的领域。我们还提供了一个互动网站,展示我们的结果 链接。
博主点评: 这篇论文提出了一种新的评估安全代理的思路,强调了成本与效益的平衡。在实际应用中,理解不同任务的经济效率对选择合适的安全工具至关重要。未来的研究应继续探索如何在保持高效能的同时降低成本。