专业工作往往从一个简短的请求开始,随后专业人员需要自行判断所需信息、相关文档以及请求前提是否成立。我们推出 DAYJOB 基准,收录了 130 项任务,由医疗(50 项)和金融(80 项)领域的从业者构建。任务估计在医疗领域平均耗时 13.6 小时,金融领域平均 16.6 小时。每项任务以容器化的 Harbor 环境提供,并配有专家制定的二元评判标准(每项任务的中位标准数分别为 47.5 条和 57.5 条),评审代理必须全部满足才能通过。我们评测了来自 13 家开发者的 30 种模型配置,表现最好的 Claude Opus 5.5 在医疗任务中通过率为 24.7%,在金融任务中为 23.9%;整体中位通过率仅为 0.6%(医疗)和 2.5%(金融)。案例分析显示,部分代理会接受与记录相矛盾的前提,并在后续分析中错误地传递输入。我们已公开全部医疗任务、80 项金融任务中的 50 项、评测框架以及排行榜。
点评