摘要
具身认知要求代理将高层任务推理与要实现的物理状态连接起来。我们介绍了 Hy-Embodied-RxBrain,这是一种具身认知基础模型,具备语言-视觉联合推理和想象力。
与强调场景理解和文本决策的视觉-语言模型,或主要预测未来视觉状态的生成世界模型不同,RxBrain 将具身计划表示为单一的规划序列,其中语言和视觉想象发挥互补作用。语言提供了计划的抽象结构,包括任务分解、规划原语、约束、时间顺序和决策逻辑,而视觉想象通过世界状态预测和联合子目标规划来扎根于这一结构,将每个规划步骤与中间和最终的物理状态关联。
RxBrain 采用统一的多模态 Mixture-of-Transformers 架构,支持在一个模型中进行语言、图像和视频的理解与生成。为了训练这一能力,我们构建了一个自动化管道,将具身视频转换为联合文本-视觉规划监督,通过将视频分解为规划步骤并与视觉状态转换对齐。
我们进一步引入了 RxBrain-Bench,以评估模型是否能够通过联合文本和视觉组件而非分开理解或生成来表示具身计划。实验表明,RxBrain 维持了具身理解和生成能力,并生成了具有耦合文本推理、世界状态预测和联合子目标规划的计划。我们还将 RxBrain 扩展到连续机器人动作生成,显示出在没有大规模动作数据预训练的情况下,良好的真实机器人性能。这些结果为具身认知的基础模型迈出了初步一步。
博主点评: RxBrain 模型通过语言与视觉的深度结合,为具身认知的研究开辟了新的方向。其在任务推理与物理状态之间的有效连接,展示了多模态学习的巨大潜力,尤其在机器人领域的应用前景令人期待。整体上,RxBrain 的设计思路与实验结果都为未来的研究提供了重要的参考。