NeFut Logo NeFut
EN 管理员登录

[AI学术] InfraBench:评估基础设施代理的能力

发布于:2026-08-13 22:00 最后更新:2026-08-14 00:05
#AI #Artificial Intelligence #Infrastructure

随着现代计算基础设施的日益复杂,管理基础设施的难度也在不断增加。近期的人工智能(AI)代理技术进步为自动化基础设施管理任务带来了机遇,但目前尚不清楚这些代理在处理现实世界基础设施复杂性方面的表现如何。我们提出InfraBench,这是一个用于评估AI代理在现实基础设施任务中的性能的基准测试套件。InfraBench涵盖了整个系统栈和整个操作生命周期,并进行了细粒度的风险评估。我们进行了15个代理模型配置的实验,结果表明,即使是最强大的代理也无法在所有任务中获得满分。平均有效得分范围从大约40%到88%(每个配置的标准误差为6-12个点),每个任务重复三次后发现,顶级配置仍然只能通过其中一部分尝试,而每次检查的评分暴露了一个通用的失败模式:代理可能经常满足短期目标,但留下了非持久的更改、破坏的分布式不变量、不安全的副作用和未清理的状态。 InfraBench(包括其实时排行榜、任务和评估工具)公开可用。 博主点评: InfraBench为评估基础设施代理的能力提供了一个全面的基准测试套件,有助于提高基础设施管理的自动化和智能化水平,推动AI技术在该领域的进一步发展和应用。

原文链接: https://arxiv.org/abs/2608.11234

[h] 返回首页