评估代理模型面临的主要难题是基准数量激增且往往需要复杂的环境和集成工作。为此我们推出 Harbor Adapters,一个统一的评估基础设施,能够把超过 80 个现有基准转化为统一的适配器,并通过严格的代码审查和等价实验确保可靠性。\ \ 在此基础上,我们对 8 种模型(覆盖不同能力层级)在 54 个基准上进行大规模实验,每个模型分别使用 Terminus-2 和三种原生 harness 进行运行。该实验揭示了模型在不同任务上的能力分布和常见失效模式,提供了比以往更全面的分析视角。\ \ 进一步,我们构建了 Harbor-Index,从适配后的基准中筛选出 82 条难度高、覆盖面广且质量上乘的任务,涉及 29 个基准。筛选过程包括难度过滤、AI 与人工审计以及审计‑修复循环,确保任务既具挑战性又可负担。实验表明,没有任何模型‑harness 配置的通过率超过 30%,最强的 GPT-5.5 + Codex 也仅达到 28.0%。\ \ 我们已开源适配器、完整评估结果、深入分析以及 Harbor-Index,旨在帮助社区实现更可靠、全面的语言模型代理评估。\ \ 点评