NeFut Logo NeFut
EN 管理员登录

[AI学术] AgentJudgeBench:评估LLM在代理工具调用中的多难度基准

发布于:2026-08-29 22:00 最后更新:2026-08-30 12:07
#Machine Learning #LLM #Artificial Intelligence

LLM 评审者被广泛用于评估具备工具调用能力的代理系统,但在结构化、依赖驱动的工作流上的可靠性尚未系统研究。为此我们推出 AgentJudgeBench,首个针对工作流有向无环图(DAG)上的 LLM‑as‑a‑judge 可靠性进行系统评测的基准。基准包含 3,808 条实例,覆盖六种 DAG 拓扑和三种难度层级,使用五种生成模型(3B‑70B 开源模型和 GPT‑5.4)和六种评审模型(20B 到前沿规模)进行评估,分别在有无真实答案的配对条件下进行。

实验发现,评审模型的对齐度随任务难度单调下降;在无真实答案条件下下降速度约为有答案时的 1.5 倍。对于高难度、无答案的查询,所有六个评审模型的对齐率收敛到 77%‑82% 的窄区间,说明任务难度主导了一个结构性上限,模型容量本身难以突破。提供真实答案并非总是有利:对 GPT‑5.4 和 Gemini‑2.5‑Pro 分别降低 1.5、3.9 个百分点,表现出“过度锚定”。在缓解策略方面,链式思考和调高温度几乎没有效果,而引入结构化评估 rubric 可提升对齐度至多 6.5 个百分点,但提升效果在不同评审‑生成器组合间并不一致。

在有真实答案时,QwQ‑32B 与程序化参考最为接近;在人类验证实验中,GPT‑OSS‑120B 被评为最符合人类判断的评审模型;在无答案条件下,前沿评审模型仅略微领先且仍受同一上限限制。整体结果揭示了当前 LLM 评审的根本局限,并给出在代理系统中进行可靠评估的实用指南。

博主点评:本工作提醒我们,单纯依赖更大模型或更高温度并不能解决评审可靠性问题,结构化 rubric 与任务难度的匹配才是关键。

原文链接: https://arxiv.org/abs/2608.26623

[h] 返回首页