NeFut Logo NeFut
EN 管理员登录

[AI学术] NavGen:基于视觉生成模型的可扩展 3D 体感导航数据引擎

发布于:2026-09-29 22:00 最后更新:2026-09-30 01:41
#Machine Learning #optimization #Artificial Intelligence

NavGen 提出一种基于高保真视觉生成模型的文本到视频数据管线,用于生成室内外的视觉语言导航(VLN)场景。该管线包括:① 使用大规模预训练的扩散或 Transformer 视频生成模型,将自然语言指令转化为对应的航拍视频;② 引入风格多样化策略,通过随机采样不同光照、天气、材质等条件,扩展长尾场景的覆盖。最终数据集约 40 万条导航片段,覆盖路径规划、目标定位等多种任务。实验表明,模型随数据规模提升表现稳步提升,在所有评估指标上均超越现有 UAV 导航数据集。进一步在真实无人机上采用 world‑action‑model 框架进行迁移测试,成功率达到 75%。

点评

原文链接: https://arxiv.org/abs/2609.30770

[h] 返回首页