行为失误会让 Transformer 看似缺乏世界模型,即使它已经学到了对环境的忠实表征。我们在 TaxiGPT 上演示了这一点:该模型在曼哈顿的随机漫步数据上进行训练,其失误曾被解读为内部地图不连贯。通过机制分析和因果干预,我们发现模型能够表示路口和街道、追踪自身位置,并利用目标指南针进行导航。模型的失误源于叠加的路口特征之间的干扰,这会破坏在内部地图中的定位。
为缓解此类错误,模型采用了“可行性打包”策略:将拥有相同合法移动的路口表征聚合,从而限制错误的传播。我们进一步提出了一组机制指示器,用于比较不同模型,并展示了世界建模能力在训练的不同阶段会逐步显现。
这些发现促使我们从“模型是否拥有世界模型”转向对其世界建模的机制性研究:即模型通过哪些相互作用的能力来表征环境并利用这些表征指导行为。
点评