视觉语言模型(VLM)代理通过内置世界建模能够在复杂推理和长时程规划中表现出色,同时降低对真实交互的依赖。
传统方法主要采用前向模拟,即预测候选动作的后果。这种仅关注未来的范式缺乏对动作与观测状态转移因果一致性的约束,容易产生看似合理却物理上不连贯的行为。
本文提出回顾式世界建模(Retrospective World Modeling),让代理通过估计归因分布 $P(\hat{a}_t|s_t, s_{t+1})$,逆向推断最可能导致给定状态转移的动作。该分布捕捉了动作在特定转移中的解释能力。
基于此,我们定义自一致性奖励(Self-Consistency Reward, SCR),作为内在信号衡量策略选取的动作与回顾式解释之间的概率一致性。SCR 越高,说明当前动作更符合对过去转移的合理解释。
将 SCR 融入强化学习框架后,代理在每一步都能获得密集的转移级反馈,既推动任务效果,又约束行为的物理合理性。
在多个多样化的代理任务上进行的大规模实验表明,相比仅使用前向世界建模的基线,回顾式方法显著提升了策略的鲁棒性和跨环境的泛化能力。
点评