NavGen 提出一种基于高保真视觉生成模型的文本到视频数据管线,用于生成室内外的视觉语言导航(VLN)场景。该管线包括:① 使用大规模预训练的扩散或 Transformer 视频生成模型,将自然语言指令转化为对应的航拍视频;② 引入风格多样化策略,通过随机采样不同光照、天气、材质等条件,扩展长尾场景的覆盖。最终数据集约 40 万条导航片段,覆盖路径规划、目标定位等多种任务。实验表明,模型随数据规模提升表现稳步提升,在所有评估指标上均超越现有 UAV 导航数据集。进一步在真实无人机上采用 world‑action‑model 框架进行迁移测试,成功率达到 75%。
点评