我们提出 VNT-PA(Visual Navigation Transformer with Pose Attention),一种以深度关键帧集合为上下文、并以相机位姿作为位置编码的Transformer规划器。传统的学习型导航策略往往把观测序列视为时间顺序的历史,位置编码绑定观测的时间戳,导致难以复用早期遍历的经验。VNT-PA 将关键帧按位姿索引,注意力计算基于关键帧之间的位姿差异,而非时间顺序,从而实现空间而非时间的上下文检索。
在训练阶段,VNT-PA 通过模仿在真实场景网格上运行的最短路径规划器进行学习。给定当前位姿和目标位置,模型仅通过查询位姿索引的空间上下文来预测下一步动作。实验在 HM3D 验证集的点目标导航任务上取得 93.3% 的成功率和 90.4% 的 SPL(路径长度加权成功率),显著优于将相同上下文编码为时间序列或仅把位姿作为输入特征的基线,在导航性能和训练效率上均有提升。
由于空间上下文是位姿标记的集合,测试时可以将不同轨迹的帧融合,进一步提升鲁棒性。相较于基于显式地图的传统规划器,VNT-PA 在定位噪声下的性能衰减更为平缓。实验表明,位姿标记的经验本身即可直接作为环境表征供学习型规划器使用,而让注意力依赖位姿差异而非时间顺序,可加速训练并提升长程导航能力。
点评:VNT-PA 的设计巧妙地将空间位姿信息嵌入注意力机制,突破了时间序列限制,为视觉导航提供了更高效、更鲁棒的学习框架。