摘要
视觉语言导航(VLN)要求具身智能体解读自然语言指令,并从时序视觉观察中预测动作。将多模态大语言模型应用于VLN需要视觉与语言的对齐、紧凑的时间输入、动作空间的基础以及在目标硬件上的稳定训练。本文介绍了PGN(Pangu Navigator),一个基于OpenPangu-7B构建的离线VLN动作预测系统。
训练过程
训练分为两个阶段:
-
PGMM对齐:通过训练Q-Former和两层MLP投影器,将冻结的EVA-ViT-G/14视觉编码器与冻结的语言主干对齐。
-
适应专家轨迹:PGN利用五个观察窗口、依赖于周期的时间采样和推理后执行的输出格式,将对齐的模型适应于专家导航轨迹;该阶段冻结对齐的视觉路径,并更新三个结构令牌嵌入和LoRA适配器。
实现细节
实现结合了混合精度计算、选择性FP32计算和DeepSpeed ZeRO-2,运行在八个Ascend 910B NPU上。在500个保留的专家轨迹上进行的教师强迫开放环评估显示,V9报告了62.29%的标准化动作匹配率(NAM)和100.00%的非空率(NER)。
这些指标量化了离线专家动作对齐,而非闭环导航成功;评估误差积累、路径效率和目标完成仍需未来工作。
博主点评: PGN系统展示了多模态大语言模型在视觉导航领域的潜力,通过精细的模型对齐和创新的训练方法,显著提升了动作预测的准确性。未来的工作应关注闭环导航与实时反馈机制的集成,以进一步提升系统的实用性和智能化水平。