NeFut Logo NeFut
EN 管理员登录

[AI学术] 交互式奖励代理:通过环境状态验证进行GUI任务评估

发布于:2026-07-30 22:00 最后更新:2026-07-30 23:39
#AI #Open Source #Reinforcement Learning

摘要

图形用户界面(GUI)任务评估旨在确定GUI代理是否成功完成用户指令。由于评估结果可以作为测试时扩展和后期训练的奖励信号,自动化GUI任务评估越来越受到关注。然而,可靠的GUI任务评估仍然具有挑战性,因为判断通常需要访问环境状态,如系统配置、文件数据和应用设置,超出了执行轨迹的截图。

在本文中,我们提出了一种基于“提出-验证”框架的交互式奖励代理(IRA),用于从执行后的环境中获取和验证证据。给定任务指令和GUI代理执行后的GUI环境,IRA首先提出任务完成条件,然后通过调用系统工具、应用工具和GUI工具进行验证。这一设计在交互过程中结合了可见界面和环境状态的证据。

我们进一步引入了GUI-RewardBench,这是一个涵盖10个Ubuntu桌面应用类别的321个GUI任务轨迹的基准。实验表明,IRA在GUI-RewardBench上达到了86.9%的准确率,超越了现有的评估基准。此外,我们将IRA应用于GUI代理的强化学习,达到了34.0%的OSWorld成功率,证明IRA能够为GUI代理的训练提供有效的奖励信号。

博主点评: 本文提出的交互式奖励代理通过结合环境状态和可视化证据,显著提高了GUI任务评估的准确性,为GUI代理的训练提供了重要的支持。这一方法在强化学习领域具有广泛的应用潜力,值得进一步探索和优化。

原文链接: https://arxiv.org/abs/2607.25904

[h] 返回首页