NeFut Logo NeFut
EN 管理员登录

[AI学术] 任务自适应评估标准用于 GUI 奖励建模

发布于:2026-08-26 22:00 最后更新:2026-08-29 12:04
#AI #Machine Learning #optimization

近期的 GUI 代理研究越来越关注结果奖励建模,即通过判断执行轨迹是否满足用户指令隐含的成功标准来分配奖励。现有的 GUI 奖励验证器在为每个任务实例构建这些标准时往往描述不足。无论是使用通用评估结构还是隐式模型推理,它们的判断标准缺乏任务自适应性:可能在任务之间直接迁移检查,忽略当前指令中的具体约束,或因强加未声明的要求而过于严格。为了解决这一问题,本文提出 AdaptRubric——一种粗细两级评估框架,通过类别层面的粗略检索和实例层面的细化生成来构建任务自适应的判断标准。首先,AdaptRubric 将指令路由到对应的 GUI 任务族,并检索可复用的任务族评估标准;随后,在实例层面生成紧凑的提示,捕获当前指令中的具体数值、范围和约束。实验在离线奖励评估和在线强化学习优化两方面进行,AdaptRubric 在相同图像预算下始终优于已有奖励模型,F1 提升 3.6 点,任务成功率提升 4.23 点。

博主点评:AdaptRubric 在任务适配性上提供了新思路,值得关注。

原文链接: https://arxiv.org/abs/2608.24174

[h] 返回首页