现代视频游戏融合了第一人称视角、快速的画面变化、持久的世界状态以及多样的原生控制。传统游戏代理直接把视觉和任务上下文映射到动作,却缺乏对世界动力学的显式建模;而交互式世界模型只能根据给定动作预测视觉未来,无法直接作为任务策略。世界‑动作模型(World‑Action Model,WAM)旨在统一这两类目标,但在视频游戏的动态和开放交互环境中仍未得到系统探索。
GameWAM 是首个面向原生闭环游戏玩法和 GUI 控制的 WAM。模型通过并行的视觉生成和动作生成过程,同时预测未来的画面观测和可执行的键鼠轨迹。关键技术包括块因果(block‑causal)条件化以及流匹配(flow matching)损失,使得视觉和动作的时序依赖能够同步学习。
为实现联合学习,作者构建了同步的游戏画面序列与 GUI 操作轨迹。每一步模型首先预测当前的操作模式(游戏模式或 GUI 模式),随后依据模式使用特定的概率分布生成离散或连续动作,并对连续动作进行归一化处理,以适配键盘、鼠标等异构输入。
在长时程交互方面,GameWAM 采用块循环控制(block‑cycle control):模型在超出已提交视野的范围内继续预测,但实际只执行预测序列的短前缀,并在新观测到来时重新规划。细粒度的循环内上下文以及层次化的跨循环历史信息共同保证了时间连续性。
实验表明,GameWAM 在多项任务上取得了与现有代理相当的成功率,同时所执行的原生动作显著更少,体现了更高的效率。
作者进一步发现了低频动作源印记(Low‑Frequency Action Source Imprinting,LASI)现象:在固定条件下,采样动作源的低频成分会系统性地驱动粗粒度的摄像机运动,暴露出生成式控制对动作源的敏感性缺陷。
博主点评: GameWAM 将世界建模与动作生成紧密结合,为游戏 AI 提供了更具解释性的框架。块因果条件化和跨周期历史的设计尤为创新,值得在更广泛的交互式环境中进一步验证。