摘要
近期的机器人基础模型主要依赖于单步或短历史的视觉运动上下文。我们提出了测试时训练机器人策略(RoboTTT),这是一种机器人模型和训练方案,能够将视觉运动上下文扩展至 8000 个时间步,是当前最先进策略的三个数量级,而不会增加推理延迟。
通过如此长的上下文长度,我们解锁了新的机器人能力:从人类视频演示中进行一次性上下文模仿、即时策略改进、对扰动的鲁棒性,以及在多阶段、长时间任务上的更强表现。
我们首次观察到,随着预训练上下文长度的扩展,闭环性能稳步提升。RoboTTT 的核心在于将测试时训练集成到机器人基础模型中,如视觉-语言-动作策略,形成一个序列模型,其递归状态由快速权重组成,这些参数在训练和推理期间通过梯度下降进行更新,压缩历史信息至权重空间并检索上下文信息以进行长上下文条件。
为了扩展训练上下文长度,该方案结合了序列动作强制与时间截断反向传播。在具有挑战性的真实机器人操控任务中,RoboTTT 相较于单步上下文基线提高了 87% 的整体性能,并成功完成了一个五分钟、十阶段的组装任务,这是任何基线模型所无法实现的。
使用 8000 时间步上下文训练的 RoboTTT 相较于同一模型的 1000 时间步预训练版本提高了 62%,这表明上下文长度是机器人基础模型新的扩展维度。
视频演示可访问 NVIDIA Labs。
博主点评: RoboTTT 的提出标志着机器人策略训练的一个重要进步,通过显著扩展上下文长度,极大提升了机器人的任务处理能力,尤其是在复杂场景下的表现。这一创新不仅提升了机器人的适应性和鲁棒性,也为未来的研究提供了新的方向,值得关注和深入探索。