AI 编码代理已在工业和学术的工程工作流中随处可见。然而,尽管它们在应用编码中得到广泛使用,却鲜有研究关注它们在生产事故响应中的执行能力。这个新兴领域被称为 agentic site‑reliability‑engineering (SRE),但现有基准存在三大局限:(1) 环境不真实,通常是玩具仓库;(2) 框架实现非标准;(3) 仅使用简单的静态验证器。\ 我们推出 Incident-Arena,一个由人工构建的基准,包含 20 项精心挑选的任务,均基于真实部署的开源软件。每项任务会在临时 Kubernetes 集群中部署生产应用,随后从配置层到底层镜像注入故障,并根据任务需求施加持续负载。我们还提出一种新颖的验证方法,超越静态检查,采用功能验证器,保持系统层面指标稳定,并确保修复过程安全。\ 在实验中,代理平均使用 2.81M token,进行 41 次交互,远超现有基准,展示了长时程推理能力。跨 20 项任务和 3 种应用基底,最前沿模型的得分均低于 64.3%,失误包括诊断/定位错误、修复不完整以及不安全的回归。\ 点评