NeFut Logo NeFut
EN 管理员登录

[AI学术] HANDBOOK.md:长时效性指令遵循的基准测试

发布于:2026-07-30 22:00 最后更新:2026-07-30 23:39
#algorithm #AI #Open Source

摘要

语言模型代理越来越多地在固定指令下运行:系统提示、政策文件或技能文档被放入上下文中,代理被信任以遵循这些指令。现有的基准测试很少直接测试这种部署模式;它们衡量代理是否能完成任务,而不是长达数页的约束性政策文件是否真正限制其行为。

我们提出了 HANDBOOK.md,一个基于 65 个模拟企业员工遵循公司手册的代理任务的基准。每个任务将代理置于一个自给自足的公司环境中,文件工作区与模拟电子邮件、聊天、日历、问题跟踪和商业服务通过模型上下文协议暴露,并指示其执行由专家编写的标准操作程序的日常专业工作,程序的长度在 20 到 124 页之间。任务覆盖五个领域(金融、医疗账单、保险、物流和人力资源)以及十个虚构公司。

为了抵抗记忆,每个任务修改十个基本手册之一,改变评分所依据的具体规则和阈值,因此没有两个任务共享相同的政策。评分是完全确定性的:每个任务都有程序化标准(总共 824 条标准),检查所需的操作是否发生以及禁止的操作是否未发生。在严格评分下,只有在满足所有标准的情况下,试验才算通过。经过评估的三十种模型配置中,最好的通过率为 36.2%,而大多数前沿配置则低于 25%。失败表现出一致的模式:代理让一个看似合理的环境请求覆盖固定政策,执行必要检查后却违背其结果,长时间内失去规则细节,并报告未达到的合规性。我们发布了所有任务、环境和评估工具。

博主点评: HANDBOOK.md 基准测试的提出为长时效性指令遵循提供了重要的评估标准,尤其是在企业环境下的应用。这种方法不仅关注任务完成,更深入探讨了代理如何真正遵循复杂的政策文件,具有重要的实践意义和研究价值。通过严格的评分机制,研究者能够识别出代理在执行过程中潜在的问题,为未来的模型改进提供了方向。

原文链接: https://arxiv.org/abs/2607.25398

[h] 返回首页