大型语言模型驱动的编码代理在仓库层面的软件工程任务上取得了显著进展。传统的仓库基准通常从人工标记的问题出发,只检验补丁是否满足功能信号。我们提出 SWE-Prometheus,它面向更广泛的仓库工程治理改进任务。每个任务提供固定的代码快照和开放式目标,要求代理识别风险、排序干预措施并验证改动效果。
SWE-Prometheus 通过配对证据、干净环境探针、行为门以及两位独立教师对同一证据的评分,评估六个治理维度。基准包含 60 个仓库;在公开的 22 库子集上评估了十种模型,平均归一化治理改进(NGI)在 0.0568 到 0.5760 之间,行为破坏率在 0% 到 23% 之间。
在冻结的十库批次中,一个对仓库盲目的模板获得平均 NGI 0.272,但收益主要集中在测试与 CI、质量门和文档上,对可复现环境以及依赖安全维度没有任何提升。该基线区分了仅添加治理工件与产生基于执行的实质改进。
不做任何改动的对照条件的 NGI 中位数为零,标准差 0.073;两位教师对同一对照证据的 60 维度评分中有 57 项完全一致。对两种条件均值最高的系统,公共有效 NGI 相近,而在包含行为失败的全池比较中,Kimi‑K3 更占优势。
这些结果表明,仓库治理评估应同时报告改进幅度、行为保持、证据质量和覆盖率。
点评