摘要
稳健的机器人抓取仍然是复杂现实应用中的一项基本挑战。近年来大规模模型的进展展示了在机器人任务推理方面的良好能力。然而,现有的抓取基准主要集中在孤立的、基于视觉的抓取姿态检测上,未能捕捉到涉及多步推理和语义理解的复杂抓取任务的复杂性。
为了填补这一空白,我们提出了 GCA-Bench,这是一项基准,包含了具有挑战性的复杂动作抓取场景,涉及场景级推理和语义约束。
GCA-Bench 允许在相同设置下评估最新的大型基础模型。为了展示我们新基准的有效性,我们实现了一系列多样化的基线,从传统的抓取检测管道到端到端学习方法。
实证研究表明,在复杂抓取场景中成功率低于 70%,突显了当前方法的关键局限性。此外,我们提出了新的评估指标,分析了关键失败模型,并提供了指导,以推动更稳健和可推广的抓取策略的发展。
博主点评: GCA-Bench 的提出为机器人抓取任务提供了更为全面的评估框架,特别是在复杂场景下的多步推理需求上,具有重要的研究价值。新的评估指标和失败分析将有助于推动该领域的进一步进展,期待更多研究者基于此进行深入探讨。