NeFut Logo NeFut
EN 管理员登录

[AI学术] PartHackBench:认证等进度压力测试用于部分积分工具代理评估

发布于:2026-09-26 22:00 最后更新:2026-09-28 00:49
#AI #Machine Learning #LLM

长时程工具代理常常在未达终点成功前取得有意义的进展,这促使评估者采用部分积分方式。然而,评估者可能会奖励那些仅是暂时里程碑、随后被逆转或并非由被评估代理真正完成的进展。若对手轨迹得分更高但实际进展相同,则比较诚实轨迹与对手轨迹并不能得出可靠结论。为消除这一混淆因素,我们提出 PartHackBench——一种受控方法论,只有当两条轨迹在当前状态谓词满足度和标准化代理归因两个维度上逐组件匹配时,私有认证者才会接受该对。随后才计算得分膨胀 $f(A) - f(H)$,其中 $A$ 为对手,$H$ 为历史基准。实验在 PB-CSTE 的 18 项封闭持出任务上进行,冻结的历史目标运行在 15 项任务中成功匹配对手。历史积分导致的平均膨胀为 0.252,条件攻击成功率为 10/15,端到端成功率为 10/18,且未检测到 14 起严格回滚。语义 LLM 判官对攻击更具抵抗力,但在评估者针对性攻击下仍易受影响;而 PB-CSTE 的当前状态控制——即认证组件的精确定义函数——在构造上保证了零膨胀。PartHackBench 因此提供了一种认证控制手段,能够在基准定义的任务相关进展保持不变的前提下,检验评估者的积分是否被不当改变。

点评

原文链接: https://arxiv.org/abs/2609.29578

[h] 返回首页