摘要
随着模型上下文协议(MCP)服务器成为连接大型语言模型(LLM)与外部工具的核心基础设施,现有基准测试利用真实的 MCP 服务器评估 LLM 代理的工具使用能力。然而,这些基准测试忽视了 MCP 服务器内工具接口和功能的持续演变,导致评估结果存在缺陷,无法准确反映代理在变化工具环境中的适应能力。为了解决这一问题,我们推出了 MCPEvol-Bench,这是一个评估 LLM 代理在动态工具集演变下任务解决能力的新基准。
受到大规模实证研究的启发,我们提出了 11 种变异操作符,以模拟 123 个 MCP 服务器内的真实工具演变。我们在多个版本的 MCP 服务器上对 12 个最先进的 LLM 进行基准测试,结果显示,即使是最前沿的模型在适应演变工具方面也面临挑战。例如,GPT-5.4 和 Claude-Sonnet-4-6 在演变的 MCP 服务器上的表现下降分别达到 13.7% 和 14.4%,同时规划和推理错误显著增加。这些发现突显了 LLM 驱动工作流的脆弱性,确立了 MCPEvol-Bench 作为评估代理在动态工具环境中适应能力的标准。
博主点评: MCPEvol-Bench 的推出为 LLM 代理的评估提供了更为全面和准确的视角,尤其是在工具演变如此迅速的当下。通过引入动态演变的概念,研究者能够更好地理解 LLM 在实际应用中的局限性与挑战,这对未来的模型开发和应用具有重要的指导意义。