GUI 代理在 Android 设备上运行时常会遭遇弹窗、误操作等动态异常,现有基准缺乏系统化评估。为此我们构建了 AnTrap,向代理的执行轨迹注入动态扰动。我们提出四层(State、Thinking、Action、Round)十个细粒度子类的异常分类,并设计了保持任务可解的构造流水线,使扰动既真实又可控。对 16 种主流 GUI 模型进行评测,结果显示所有模型均对动态异常高度脆弱,最强模型的性能亦出现显著下降。进一步在原始和对抗环境中进行 GRPO 训练,区分可通过环境学习的异常与受推理瓶颈限制的异常。实验表明,状态层和动作层的单步陷阱可通过对抗强化学习显著缓解,而深层上下文陷阱(如状态死锁)暴露出模型固有的推理局限,仅靠在含陷阱的环境中训练难以克服。
博主点评: AnTrap 为评估 GUI 代理的鲁棒性提供了系统化工具,揭示了单步异常可通过对抗学习缓解,但深层上下文异常仍是模型的根本瓶颈,提示未来研究需在推理结构上进行突破。