NeFut Logo NeFut
EN 管理员登录

[AI学术] 面向代理评估的可信层

发布于:2026-10-07 22:00 最后更新:2026-10-08 01:25
#algorithm #AI #Machine Learning

确定性基准分数只能说明代理获得了信用,却无法判断该信用是否真实、报告是否诚实,或在二次运行时是否仍然成立。我们提出 可信层(Trust Layer),一种后置加法框架,在每个记录分数旁边给出该分数是否可信的判断。该层验证四个属性:

  1. 结果是否符合基准自身的评分逻辑;
  2. 通过可追溯计算获得的及格答案;
  3. 代理的完成声明是否与实际发生相符;
  4. 结果在重复执行下是否保持稳定。前三项仅依赖已保存的工件,第四项需要重新运行代理。模型判断仅在多数投票下标记证据,所有裁决遵循确定性规则,且不修改原始分数。

我们在 Agents' Last Exam 的 108 任务上,对五种代理配置进行实验。结果显示:每个模型都有通过运行却缺乏可追溯计算的情况,比例相差十倍;存在明确的虚假完成声明;并且结果不稳定——在五次运行中,18%‑46% 的任务分数带会变化。仅有 22.6%(95% CI 15.0‑32.6,n=84)的记录通过了全部四项检查。

该研究表明,衡量代理能做什么与验证其实际完成的行为是两个不同的问题,而现有基准仅关注前者。

点评

原文链接: https://arxiv.org/abs/2610.07274

[h] 返回首页