一个需要记住自己在网页上执行过哪些操作的代理必须判断何时两页可以视为相同。传统的基于观察相似性的记忆会把外观相似但交互行为不同的页面合并,而 GUI 中常出现这种情况:同一组件的两个标签页或同一菜单的两行在点击时会产生不同的响应。我们将合并规则定义为动作条件双模态等价(action‑conditioned bisimulation),它作用于代理在交互过程中填充的经验预测状态图(empirical predictive state graph),该图在代理执行时保持冻结。只有当两个状态共享的动作在相同的可供性标签(affordance label)下产生一致的结果并指向相同的后继块时,才会被合并。观察相似性不参与合并规则,整个过程不涉及任何训练。该规则取代了已有的结果价值记忆的合并机制,因而在闭环比较实验中可以单独评估其效果。实验在 MiniWoB++ 环境中进行,结果显示相较于无记忆的基线代理,使用动作条件双模态等价的代理成功率显著提升;而采用相同探索路径的对照实验、先前的后继表示合并以及去除动作条件的同等准则均未带来提升。
点评:该工作展示了在无需额外训练的前提下,通过严格的动作条件等价关系实现更可靠的 GUI 记忆合并,为提升基于网页交互的强化学习代理的鲁棒性提供了新思路。