SteerBench-Work 是一个基准测试,用于评估长期运行的 LLM 代理在行动边界的决策能力。这个基准测试包括 106 个场景,这些场景是基于公开的事件,包括开发运维、客户服务、金融、法律、医疗、人力资源和安全等领域。每个场景都有一个对应的证据反转镜像和校准控制,标签均匀分布在“继续”和“等待人工或政策审查”之间。模型会根据提出的行动和可用的证据做出决策,并根据决策的正确性进行评分。 结果表明,模型在错误的方向上失败的次数几乎相同,其中错误地等待授权的工作占 28.1%,错误地允许不安全的工作占 1.0%。最难的场景是风险解决的提交,模型在证据反转镜像上的表现明显较差(63.8%)而在原始事件上表现较好(98.5%)。这表明,提高模型的能力并不一定能提高其在行动边界的决策能力。 博主点评: SteerBench-Work 为我们提供了一个评估 LLM 代理在行动边界决策能力的基准测试。这一基准测试有助于我们了解模型在不同场景下的决策表现,并为改进模型的决策能力提供了方向。