NeFut Logo NeFut
EN 管理员登录

[AI学术] SteerBench-Work:行动边界代理导航基准

发布于:2026-08-15 22:00 最后更新:2026-08-16 07:03
#Machine Learning #LLM #Artificial Intelligence

SteerBench-Work 是一个基准测试,用于评估长期运行的 LLM 代理在行动边界的决策能力。这个基准测试包括 106 个场景,这些场景是基于公开的事件,包括开发运维、客户服务、金融、法律、医疗、人力资源和安全等领域。每个场景都有一个对应的证据反转镜像和校准控制,标签均匀分布在“继续”和“等待人工或政策审查”之间。模型会根据提出的行动和可用的证据做出决策,并根据决策的正确性进行评分。 结果表明,模型在错误的方向上失败的次数几乎相同,其中错误地等待授权的工作占 28.1%,错误地允许不安全的工作占 1.0%。最难的场景是风险解决的提交,模型在证据反转镜像上的表现明显较差(63.8%)而在原始事件上表现较好(98.5%)。这表明,提高模型的能力并不一定能提高其在行动边界的决策能力。 博主点评: SteerBench-Work 为我们提供了一个评估 LLM 代理在行动边界决策能力的基准测试。这一基准测试有助于我们了解模型在不同场景下的决策表现,并为改进模型的决策能力提供了方向。

原文链接: https://arxiv.org/abs/2608.12654

[h] 返回首页