确定性基准分数只能说明代理获得了信用,却无法判断该信用是否真实、报告是否诚实,或在二次运行时是否仍然成立。我们提出 可信层(Trust Layer),一种后置加法框架,在每个记录分数旁边给出该分数是否可信的判断。该层验证四个属性:
- 结果是否符合基准自身的评分逻辑;
- 通过可追溯计算获得的及格答案;
- 代理的完成声明是否与实际发生相符;
- 结果在重复执行下是否保持稳定。前三项仅依赖已保存的工件,第四项需要重新运行代理。模型判断仅在多数投票下标记证据,所有裁决遵循确定性规则,且不修改原始分数。
我们在 Agents' Last Exam 的 108 任务上,对五种代理配置进行实验。结果显示:每个模型都有通过运行却缺乏可追溯计算的情况,比例相差十倍;存在明确的虚假完成声明;并且结果不稳定——在五次运行中,18%‑46% 的任务分数带会变化。仅有 22.6%(95% CI 15.0‑32.6,n=84)的记录通过了全部四项检查。
该研究表明,衡量代理能做什么与验证其实际完成的行为是两个不同的问题,而现有基准仅关注前者。
点评