近期的网页代理在测试时通过采样候选动作、预测相应的网页状态并使用排序模型或过程奖励模型(PRM)进行打分。传统的世界模型采用监督式的下一状态预测,输出固定的 HTML 或 AXTree 快照。然而,这一目标与下游排序器不匹配:排序器需要预测的状态在不同候选之间具有可区分性,以便准确评分。
为了解决该问题,本文提出 预测状态匹配(predicted‑state matching)训练目标。模型必须能够将真实的后继状态与其他候选动作产生的状态区分开来。我们基于 WebArena Go‑Browse 轨迹构建了一个分支网页代理数据集,每个决策点包含多个备选动作及其对应的网页状态。
实验在我们持出的预测状态匹配基准上进行。结果表明,使用预测状态匹配训练的世界模型显著优于传统的监督式下一状态预测模型。在 WebPRMBench 上,结合该模型的 PRM 能够超越仅使用动作的 PRM 以及加入监督式世界模型的 PRM。进一步在 WebArena‑Lite 上进行端到端任务评估时,使用该世界模型进行测试时动作选择可提升任务成功率。