NeFut Logo NeFut
EN 管理员登录

[AI学术] InferenceBench:开放式 LLM 推理优化的全新基准测试

发布于:2026-07-24 22:00 最后更新:2026-07-26 07:44
#AI #optimization #Open Source

摘要

AI 代理日益被用于自动化研究与开发任务,然而现有基准测试通常在规定的工作流程或狭窄的行动空间内评估它们。即使是名义上的开放式任务,往往也可以通过检索已知的解决方案并调整少量超参数来解决,这使得强大的结果是否反映真正的优化还是记忆的解决方案变得不清晰。

我们推出了 InferenceBench,代理必须部署一个兼容 OpenAI 的推理服务器并优化 LLM 推理的速度。每个代理获得一个目标 LLM、一块 H100 GPU、一个优化场景和一个两小时的墙钟时间预算。三个优化场景隔离推理的不同瓶颈(预填充延迟、解码延迟和并发请求吞吐量),第四个场景同时平衡这三者。

在 15 种前沿代理配置下,代理在简单的 PyTorch 基线之上可靠地提升了性能(高达 $8.08\times$),并且通常与默认设置的服务引擎相匹配或超越(对于 vLLM 为 $4.05\times$),但仍低于在相同时间预算下的简单超参数搜索(高达 $11.53\times$)。对代理轨迹的定性分析显示,尽管代理列举了许多相关的优化技术,但它们往往收敛于单一推理框架。它们仅测试少数不同的配置,剩余的预算大多用于重新测量、修复或优化超参数,而不是探索实质性不同的策略。这表明瓶颈并非是领域知识,而是提出多样化配置、系统评估它们并提交最佳识别解决方案的能力。

总体而言,InferenceBench 反映了代理在开放式 AI 工程环境中的操作能力,记忆的解决方案往往导致有限的改进。

博主点评: InferenceBench 提供了一个新视角来评估 AI 代理在推理优化中的表现,强调了多样化策略的重要性。尽管当前的优化效果显著,但对于复杂问题的深入探索仍然至关重要,未来的研究应着重于提高代理的创新能力和配置多样性。

原文链接: https://arxiv.org/abs/2607.20468

[h] 返回首页