NeFut Logo NeFut
EN 管理员登录

[AI学术] SeekJudge:强化学习中的实用奖励框架

发布于:2026-07-29 22:00 最后更新:2026-07-30 03:24
#Reinforcement Learning #Evaluation #Model-Based

在计算机使用代理的长时间图形用户界面任务中,决定一个轨迹是否真正满足其指令是我们评估和训练它们的关键。这个判断长期以来依赖于基于规则的评估,这种方法难以与人类意图对齐,并且在应用程序更新或在线内容漂移时容易失效。现有的基于模型的判断者试图解决这些问题,但与基于规则的评估之间仍存在性能差距。我们提出了SeekJudge框架,其中四个角色专业化的代理——Condense、Ground、Seek和Analyze——通过对轨迹的Seek-Analyze循环达成最终判断。一个经过种子校准的蒸馏管道训练了一个专用的$9$B模型,作为所有四个代理的共享骨干。通过在保留的强化学习测试目标上测量的下游成功率,SeekJudge是第一个在在线强化学习中匹配或超越本地规则基础监督的实用模型基础奖励。除了准确性,SeekJudge还提供逐步的判断,运行成本远低于闭源大模型,并且保持小的每次调用上下文,能够扩展到更长的轨迹。此外,我们进一步贡献了对奖励服务器的一般架构改进,加速了强化学习中的判断过程。总体来看,这些使得基于模型的奖励成为计算机使用代理强化学习中基于规则监督的实用替代品。

博主点评: SeekJudge 框架通过引入多个专业化的代理,显著提升了基于模型的奖励系统的实用性,解决了传统方法的局限性。这种创新不仅提高了评估的准确性,还降低了成本,展现了强化学习领域的重大进步。其架构改进也为未来的研究提供了很好的借鉴。

原文链接: https://arxiv.org/abs/2607.23263

[h] 返回首页