NeFut Logo NeFut
EN 管理员登录

[AI学术] IMBench:评估直观机器人操控的新基准

发布于:2026-07-21 22:00 最后更新:2026-07-22 01:01
#algorithm #AI #Open Source

在复杂的操控任务中,人类能够结合推理与运动控制,在多样的约束下完成任务。他们对物理世界的理解使其能够将推理转化为动作,并迅速适应新场景、任务和规则。这种能力被称为直观操控。现有的基准测试未能捕捉到这种整合:要么在孤立的情况下评估物理推理,要么在无需明确推理的情况下测量策略性能。

我们提出了 IMBENCH,一个旨在评估直观操控作为一个综合能力的基准,涵盖感知、物理推理、动作生成和迭代执行。我们的任务要求模型推断与任务相关的物理结构,并在明确约束下生成可行的动作序列,包括接触丰富的操控、工具使用和多阶段依赖。

IMBENCH 包含 35 个任务、14K 个经过筛选的轨迹,以及可扩展的工具以生成多样化场景。实验揭示了一个持续的差距:视觉语言模型显示了一定的物理推理能力,但未能生成可执行的计划,而最先进的视觉-语言-动作模型在满足任务约束和跨场景泛化方面也存在困难。这些结果表明,直观操控是当前基础模型和通用机器人策略中缺失的一个维度,并将 IMBENCH 定位为评估和促进更综合、适应性物理智能的一个步骤。

博主点评: IMBench 的提出填补了机器人操控领域的一个重要空白,强调了推理能力与执行能力的结合。此基准不仅为模型评估提供了新工具,也为未来机器人技术的发展指明了方向。其在处理复杂任务中的应用潜力值得关注。

原文链接: https://arxiv.org/abs/2607.15641

[h] 返回首页