NeFut Logo NeFut
EN 管理员登录

[AI学术] 基于Ackermann转向移动机器人的连续环境视觉语言导航的仿真到真实迁移

发布于:2026-10-07 22:00 最后更新:2026-10-08 01:25
#algorithm #AI #Machine Learning

Vision-Language Navigation(VLN)使机器人能够依据自然语言指令在环境中移动,提升人机交互的自然度。传统VLN模型依赖导航图、全景视角和精准定位,这在真实场景中难以实现。本文提出一种在连续空间中工作且不需要导航图或全景图的VLN方法,并实现了从仿真到真实的域迁移。

系统核心是将视觉输入和语言指令映射到同一嵌入空间的跨模态注意力(Cross‑Modal Attention,CMA)网络。该网络在公开的仿真数据集上预训练,然后使用自行搭建的Ackermann转向移动机器人采集的实景数据进行微调。机器人配备前置摄像头和LiDAR,采集的图像经过线性光度校正以缩小仿真‑真实差异。微调仅在数十个episode上完成,模型即可在真实环境中离线运行于专用硬件上。

实验采用Success weighted by Path Length(SPL)和Normalized Dynamic Time Warping(nDTW)两项指标评估。结果显示,经过少量实景微调后,模型在真实环境中的SPL和nDTW均接近仿真水平,验证了方法的鲁棒性和适应性。点评

原文链接: https://arxiv.org/abs/2610.07192

[h] 返回首页