NeFut Logo NeFut
EN 管理员登录

[AI学术] 提升大规模机器人后训练中的人类效率:VLAC-CUT 指导的管道方案

发布于:2026-07-15 22:00 最后更新:2026-07-17 08:46
#AI #robotics #Open Source

在将视觉语言行动(VLA)模型适应下游任务时,需要进行多轮后训练,因为单轮数据无法解决所有问题,必须进行持续迭代以逐步应对前几轮暴露出的弱点。本文旨在最大化后训练过程中的人类效率,定义为每单位人力和时间所实现的策略改进和任务吞吐量。

我们提出了一种人类高效的后训练管道,使少量人类操作员能够监督多台机器人。该管道围绕专业化的劳动分工构建:经过训练的遥控操作员专注于高价值的远程干预和恢复演示,而地面操作员则监控多台机器人,触发接管并进行物理重置。这种角色专业化减少了任务切换,降低了操作员培训成本,使有限的人力能够监督更多机器人的交互。

为了提高数据利用效率,我们引入了VLAC-CUT作为自动化的回滚策划工具。它将自主机器人轨迹分割为进展、闲置、失败诱导和恢复部分,保留有用的片段,同时过滤掉有害或无信息的内容。策划后的回滚数据与人类参与数据结合,用于下一轮后训练。

我们在四个真实世界的操作任务上验证了所提管道。在迭代的后训练轮次中,最终策略达到了80\%--95\%的成功率,任务吞吐量提高了1.7$\times$--4.2$\times$,相较于基础模型。在相同的人类干预预算下,VLAC-CUT指导的回滚重用在成功率和吞吐量上都优于仅依赖人类参与的训练。

博主点评: 本文提出的VLAC-CUT管道通过明确分工和数据策划,显著提升了机器人后训练的效率,为大规模机器人系统的应用开辟了新路径,充分展示了人机协作的潜力和未来的发展方向。

原文链接: https://arxiv.org/abs/2607.09776

[h] 返回首页