NeFut Logo NeFut
EN 管理员登录

[AI学术] 面向桌面 GUI 代理的基于动作诱导视觉差异的反思

发布于:2026-08-26 22:00 最后更新:2026-08-29 12:04
#algorithm #AI #Machine Learning

Planner-Operator-Reflector(POR)框架在桌面 GUI 代理中被广泛采用,通过规划器、操作器和反射器的模块化协作保持目标对齐。

然而,桌面 GUI 往往界面庞大且信息密集,状态变化往往细微且分散,导致大部分工作落在反射器上,需要比较动作前后的屏幕,而规划器和操作器只能基于单一状态进行推理。

现有的反射器将变化检测与结果验证合二为一,证据隐式存在,导致决策缺乏扎实依据。

为此我们提出 Evidence-First Reflection(EFR),一种两阶段的反射器,首先显式提取动作诱导的视觉差异,再进行结果验证。

EFR 使用 Set‑of‑Marks 注解来标记动作位置及候选变化区域,随后描述并过滤与动作相关的变化,最后基于清理后的证据做出最终判断。

这种证据优先的设计使反射过程更直接依赖屏幕转变,显著降低视觉搜索复杂度和推理负担。

在 OSWorld‑Verified 与 WindowsAgentArena 两个基准上实验表明,EFR 将反射器准确率提升 7.11%,端到端任务成功率分别提升 5.94% 与 4.95%。

博主点评: EFR 的两阶段解耦思路为 GUI 代理的视觉推理提供了更可靠的证据链,尤其在复杂桌面环境中展现出明显的性能提升,值得在实际系统中进一步推广。

原文链接: https://arxiv.org/abs/2608.24015

[h] 返回首页