NeFut Logo NeFut
EN 管理员登录

[AI学术] PGN:基于Pangu多模态基础模型的视觉语言导航系统设计与实现

发布于:2026-07-22 22:00 最后更新:2026-07-23 12:33
#algorithm #AI #Machine Learning

摘要

视觉语言导航(VLN)要求具身智能体解读自然语言指令,并从时序视觉观察中预测动作。将多模态大语言模型应用于VLN需要视觉与语言的对齐、紧凑的时间输入、动作空间的基础以及在目标硬件上的稳定训练。本文介绍了PGN(Pangu Navigator),一个基于OpenPangu-7B构建的离线VLN动作预测系统。

训练过程

训练分为两个阶段:

  1. PGMM对齐:通过训练Q-Former和两层MLP投影器,将冻结的EVA-ViT-G/14视觉编码器与冻结的语言主干对齐。

  2. 适应专家轨迹:PGN利用五个观察窗口、依赖于周期的时间采样和推理后执行的输出格式,将对齐的模型适应于专家导航轨迹;该阶段冻结对齐的视觉路径,并更新三个结构令牌嵌入和LoRA适配器。

实现细节

实现结合了混合精度计算、选择性FP32计算和DeepSpeed ZeRO-2,运行在八个Ascend 910B NPU上。在500个保留的专家轨迹上进行的教师强迫开放环评估显示,V9报告了62.29%的标准化动作匹配率(NAM)和100.00%的非空率(NER)。

这些指标量化了离线专家动作对齐,而非闭环导航成功;评估误差积累、路径效率和目标完成仍需未来工作。

博主点评: PGN系统展示了多模态大语言模型在视觉导航领域的潜力,通过精细的模型对齐和创新的训练方法,显著提升了动作预测的准确性。未来的工作应关注闭环导航与实时反馈机制的集成,以进一步提升系统的实用性和智能化水平。

原文链接: https://arxiv.org/abs/2607.17806

[h] 返回首页