NeFut Logo NeFut
EN 管理员登录

[AI学术] Workflow-GYM:评估计算机代理在真实专业领域的长期任务能力

发布于:2026-07-21 22:00 最后更新:2026-07-22 01:01
#algorithm #AI #Open Source

摘要

近年来,人工智能代理在处理越来越复杂的现实任务方面迅速发展。然而,现有基准测试很少评估代理是否能够操作图形用户界面(GUI)以完成跨多个领域的长期、高价值专业工作流。当前的GUI基准主要集中于通用软件、相对简单的应用程序和短期任务,导致我们对现代代理能否遵循用户指令自主操作特定领域的专业软件并以端到端的方式完成经济价值工作知之甚少。

为填补这一空白,我们推出了Workflow-GYM,这是一个针对专业领域和专用软件环境的长期GUI任务基准。通过对最先进模型的广泛实验,我们发现即使是最强大的模型,其成功率也仅略高于30%。这突显了专业长期GUI工作流对当前GUI代理依然是极具挑战性的任务。

进一步分析表明,当前代理在保持长期工作流一致性方面存在困难,常常表现出工作流阶段遗漏、错误传播、目标漂移以及对专业软件环境理解不足等问题。我们的研究结果为当前代理系统的局限性提供了重要见解,并为下一代GUI代理研究指明了关键方向。

博主点评:Workflow-GYM的推出标志着AI代理在复杂专业环境中评估的重要一步。尽管当前模型表现不佳,但这为未来的研究提供了方向,尤其是在如何提升代理对长周期任务的适应能力上。了解这些局限性将有助于推动更高效的AI代理技术发展。

原文链接: https://arxiv.org/abs/2606.11042

[h] 返回首页