NeFut Logo NeFut
EN 管理员登录

[AI学术] 全面评估:实体视觉与语言导航的系统性研究

发布于:2026-07-15 22:00 最后更新:2026-07-17 08:46
#algorithm #AI #Machine Learning

摘要

导航是自主系统的基本能力,但现有方法大多依赖高度结构化的模型和强假设,限制了它们在开放和不确定的真实环境中的鲁棒性。视觉与语言导航(VLN)通过使机器人以数据驱动的方式集成自然语言理解与视觉感知,为解决这一问题提供了有希望的方向。

尽管VLN受到越来越多的研究关注,但系统的方法分类和真实世界的验证仍然有限。本调查综述了VLN研究的全面情况。具体而言,最先进的方法沿着两个正交维度进行组织:行动范式,包括层次化和单体框架;模型范式,包括判别和生成方法。文中提供了对它们各自优缺点的批判性分析。

此外,我们对代表性的VLN系统配置在物理机器人平台上进行了系统的真实世界评估。在十个不同的真实场景中的实验显示,在测试的配置下,模拟与真实世界部署之间存在显著的性能差距:一个典型的单体RGB-only方法在模拟中成功率为61%,但在真实世界中降至22%;而层次化框架在真实世界中的成功率为51%,显示出在我们的评估设置中更强的鲁棒性。

最后,我们强调了未来研究中必须解决的感知、决策和控制的关键挑战。

博主点评: 本文对视觉与语言导航的系统性评估提供了重要的见解,尤其是对模拟与现实之间的性能差距进行了深入分析,强调了在实际应用中鲁棒性的重要性。未来的研究需聚焦于提升模型在复杂环境中的适应能力。

原文链接: https://arxiv.org/abs/2607.09792

[h] 返回首页