MIT研究人员开发了一种新方法,使机器人在执行动作时更好地进行前瞻性思考,从而实现更平滑的运动和更快的反应。这一技术使得规划机器人运动的人工智能模型能够预测其未来位置,并基于此预测将当前运动无缝过渡到下一步行动。许多现有方法导致机器人在思考下一步时停顿,从而造成动作缓慢和不流畅。MIT的方法通过基于机器人的未来状态而非当前位置进行计算,显著提升了机器人的操作速度。重要的是,这种技术并未增加规划过程的计算开销,并且可以应用于多种机器人硬件。
该方法使机器人在执行如抓取和放置等任务时的速度提高了一倍,同时显著减少了动作间的延迟时间。它还提升了机器人手臂在动态活动中的表现,如乒乓球和打地鼠。该系统尤其适用于在紧急响应或搜救等挑战性现实环境中执行快速灵活操作的机器人,并能使机器人在纠正错误时更快反应。
MIT电气工程与计算机科学系副教授、该方法论文的主要作者宋汉表示:“这项工作为高效、快速、加速和低成本的机器人应用奠定了良好的基础。我们期待将我们的研究扩展到最新的世界动作模型,使其在不断推动物理AI加速的过程中具有更强的能力。”
在先进的机器人应用中,生成式AI系统称为视觉-语言-动作(VLA)模型,充当机器人的“大脑”,规划下一步动作并执行这些动作。VLA模型从机器人摄像头获取环境观察和任务指令,将接下来的几步动作作为一组输出,然后在机器人硬件上执行这些动作。然而,VLA推理过程在实时处理视觉输入、推理任务和输出动作时计算要求高,导致机器人在规划下一步时可能出现明显的停顿,影响动作的流畅性。
为了加快反应速度,MIT研究人员开发了一种名为VLASH的新系统,使VLA能够预测机器人及其环境的未来状态,同时在机器人完成当前动作时规划下一组动作。VLASH避免了许多其他方法在当前状态基础上预测下一步时出现的失调问题。
为了进一步加快速度,研究人员生成粗糙的动作块,使机器人执行几个遵循相同轨迹的较大步骤,这种技术称为动作量化。虽然动作量化会略微影响准确性,但使机器人完成整体任务的速度提高了两到三倍。研究人员还开发了一种训练增强方法,使VLA学习使用未来状态信息而非当前观察,从而实现了五倍的训练加速,而没有额外的计算开销。
与基线方法相比,VLASH在仿真中表现出更快的速度,同时保持了机器人动作的准确性。该系统在实际硬件上的表现也优于这些方法,尤其是在抓取和放置、堆叠和分类任务中。例如,VLASH在将颜色分类的立方体放入盒子时的速度是基线方法的两倍,同时保持了90%的准确率。未来,研究人员希望将VLASH与更强大的生成AI系统结合,以提高性能并开辟新应用。这项研究得到了MIT-IBM计算研究实验室、亚马逊、国家科学基金会和英伟达的支持。
博主点评: MIT的这一突破性研究为机器人运动的实时规划提供了全新的思路,通过前瞻性思维提升了机器人的反应速度和灵活性。这不仅减少了运动间的延迟,还为未来的动态任务应用奠定了基础,具有广泛的应用前景。进一步结合更强大的生成AI系统,将可能推动机器人技术的革命性进步。