LLM 代理正快速从实验走向生产,承担客服、争议裁决和内部系统运营等任务。构建这些代理的工作越来越交给编码代理,但现有基准几乎不涉及在真实客户项目条件下交付完整代理的能力。
我们提出 τ^τ‑bench(读作 hyper‑tau‑bench),把代理构建本身设为任务。开发者代理获得企业实际保存的记录、持有需求的客户、必须通过的生产 API、可继承的代码库以及服务成本和模型使用的限制——这正是一次真实合作的起点。基于这些信息,代理需要交付一个完整的客服代理,并通过在未见的模拟用户上部署来评分。
在覆盖四个领域的 53 项任务中,表现最好的配置是 Claude Opus 5 搭配 Claude Code,仅通过 23.9% 的评估模拟;而专家手写的参考上限可达 82.2%。失败模式与人类开发者遇到的相似:模型往往只发出浅层查询,未能深度理解记录;几乎不向客户反馈;对代理架构和服务开支的实验不足,往往直接交付首个可运行的设计。
τ^τ‑bench 旨在把协同构建代理的工作转化为可度量的目标,为编码代理提供明确的改进方向。
点评