我们提出了 SynthDemo‑RL,一个教师‑学生框架,用于在视觉‑语言‑动作(VLA)模型的微调中克服稀疏二元奖励导致的探索困难。教师利用仿真器内部状态自动生成成功的操作轨迹,学生通过监督微调(SFT)从这些合成示例中学习,然后在二元任务成功奖励下使用 PPO 进一步优化。
为评估稀疏奖励的覆盖程度,我们引入了 reward coverage 指标,即在固定评估协议下至少出现一次成功的任务比例,作为平均成功率的补充。在公开基准 LIBERO‑PRO(包含 57 项无示例的扰动任务)上,原始 pi_0.5 策略在 27 项任务上成功率为 0%。直接在同样的 PPO 配置和计算预算下进行强化学习,仅恢复了其中 10 项任务,剩余 17 项仍为 0%。
SynthDemo‑RL 为每个任务合成 50 条轨迹,且不使用任何新的人类示例,成功恢复了全部 27 项任务,并在 LIBERO‑PRO 的 Position 和 Task 两个维度上分别达到了 97.8% 与 97.1% 的平均成功率。相同流程在标准 LIBERO 上也取得了 96.0% 的成功率,仅比使用每任务 50 条人类示例训练的 pi_0.5 低 1.7 个百分点。
我们进一步在 RoboTwin 2.0 上验证了该管线,证明在 MuJoCo 双胞胎中训练的策略生成的轨迹能够在真实机器人上以开环方式执行。
点评