NeFut Logo NeFut
EN 管理员登录

[AI学术] 什么让 Terminal-Bench 任务变得困难?区分真实难度与伪难度

发布于:2026-09-25 22:00 最后更新:2026-09-28 00:49
#AI #Machine Learning #LLM

前沿基准需要模型当前无法解决的任务,但零通过率并不必然意味着任务本身难。相同的全失效可能源于真实的能力缺口,也可能是缺失上下文、参考解答损坏、基础设施故障或验证器可被绕过导致的。本文利用冻结的 Terminal-Bench 3 / Frontier-Bench 0.1 生产记录进行研究,记录包括 1,081 条 pull request、639 个计分任务、28,801 次试验以及 $105,933 的代理支出。我们关注 125 个没有任何诚实通过的任务,结合任务产物、参考解答运行、空解控制、对抗试验、轨迹、遥测以及审查记录,按顺序进行有效性筛选,最终仅有 78 项通过,成为认证的未解任务。其余任务中有 14 项出现破损的判据、8 项受基础设施故障主导、4 项只能通过绕过验证器完成、21 项缺乏足够证据证明其可解性。因此,缺乏饱和度并不等同于真实难度。认证未解标签的含义也很狭窄:它要求作者路线通过、基础设施未主导、未观察到严格的绕过,并且所有评估的代理均失败,但它并不证明任务本身固有的难度、验证器的完备性或针对预期能力的失败。我们进一步分析被拒的提交和通过的任务,表明仅凭通过率无法解释任务的困难程度。总体而言,前沿基准在将全失效任务作为能力声明之前,应公开支撑这些任务的证据。

点评

原文链接: https://arxiv.org/abs/2609.26826

[h] 返回首页