摘要
大型语言模型(LLM)代理越来越多地部署在模型上下文协议(MCP)服务器上,然而,目前用于评估它们的基准测试仅评分最终答案或固定的“真实”工具列表,这在底层数据为实时和状态驱动时显得脆弱。为此,我们提出了DynamicMCPBench,一个可重用的框架,而非固定的数据集。实践者可以在自己的MCP服务器上运行它,以测试模型在特定任务上的表现,或者让其自动收集服务器以测量模型解决代理任务的通用能力。
给定服务器和任何一组模型,DynamicMCPBench生成现实的目标,实时追踪每个目标以记录成功的轨迹,将该轨迹提炼为与路径无关的效果检查点,并评分代理是否能够重现这些效果,而不是最终答案。为了展示该框架的揭示,我们在规模上运行它:在121个服务器和750个任务上测试24个模型,这些任务均匀分布在15个任务类别(每类50个)中,每个类别针对生成问题的不同工具使用挑战。每个任务通过pass^3进行评分:仅当所有三个独立尝试都成功时,它才算解决。
即使是最强的代理也仅解决了大约一半的任务,31%的任务完全没有模型解决,随着所需工具链的增长,准确率显著下降(从最短链的39%降至最长链的13%)。一项人类验证研究确认了自动评分的可靠性(机会校正一致性为0.76)。因此,DynamicMCPBench将基准构建转变为实践者可以在自己的服务器和模型上重新运行的过程,同时揭示了当前代理在处理长的多步骤代理任务方面的一致性不足。
博主点评: DynamicMCPBench的提出填补了实时环境下LLM代理评估的空白,强调了动态基准测试的重要性。通过允许用户在自己的MCP服务器上运行测试,这一框架不仅提升了评估的灵活性,还揭示了现有模型在复杂任务上的不足,展现了未来优化的方向。其评分机制也为进一步研究提供了可靠的依据,值得关注!