摘要
在室内环境中,物体目标导航要求具身代理定位并到达指定物体类别的实例。最近的无训练方法利用视觉-语言模型(VLMs)进行开放词汇语义推理,但通常在每个回合后重置所有场景特定状态的情境协议下进行评估。我们提出了跨情境物体目标导航,代理在同一场景中重复操作,仅保留自我获得的经验,并保持模型参数不变。
为了支持经验重用,我们提出了 VTM(Visual-Topological Memory),这是一个无训练的 VLM 导航框架,具有持久的分层视觉-拓扑记忆。VTM 在房间和物体层次上组织场景知识,并通过粗到细的匹配检索相关经验,仅在与当前观察一致时提供软指导的记忆。保守的执行保护进一步减轻了振荡、阻塞运动和过早停止的问题。
在受控的同场景协议下,我们在三个基准上评估了 VTM-Nav,分别是 HM3D v0.1、HM3D v0.2 和 MP3D,并将其与增强了跨情境文本记忆的 WMNav 基线进行比较,同时保持 VLM 主干和动作管道一致。VTM-Nav 在所有三个基准上均取得最佳性能,展示了跨数据集结构化视觉-拓扑经验重用的有效性和鲁棒性。
博主点评: VTM-Nav 的引入标志着目标导航领域的一个重要进步,通过创新的视觉-拓扑记忆机制,不仅增强了模型的适应性,还显著提高了在复杂环境中的导航能力。这一方法的成功或将推动未来智能代理在动态环境中的应用研究。