现代机器人模仿学习越来越依赖基于扩散或流匹配的生成策略,这类策略通过将先验分布的样本映射为动作来实现决策。一个核心问题是先验的选择是否会显著影响性能。已有研究表明,在从零训练时,用更接近目标分布的非高斯先验(如基于经验数据的 $p_{\text{target}}$)可以显著提升表现,优于标准高斯先验 $\mathcal{N}(0, I)$。
本文进一步探讨该结论在微调预训练的大型行为模型(LBM 1.0、$\pi_{0.5}$、GR00T~N1.5)时是否仍然成立。直觉上,微调应当放大先验带来的收益,尤其在数据稀缺的情形下。实验覆盖了超过 100K 次仿真回合,涉及 40+ 任务、两个仿真平台,以及在五个双臂操作任务上的 1250 次真实硬件回合。结果出乎意料:除极低的微调数据比例外,非高斯先验的微调性能与标准高斯先验基本无差异,甚至在部分任务上略逊。
诊断分析显示,尽管微调后编码器的嵌入向量与预训练阶段以及不同先验之间出现显著分歧,最终的动作预测却在所有先验下趋于一致。这表明微调过程中的关键因素是编码器的学习率和训练力度,而非先验本身。进一步的学习率消融实验证实,提升编码器的学习率能够显著改善微调效果,远超先验选择的影响。
综上,本文认为在大规模预训练行为模型的微调阶段,先验的非高斯化并非关键因素。未来的研究可以聚焦于何种情形下学习到的先验仍然有价值,例如极端低数据 regime、跨域迁移或在特定约束下的动作空间建模。
点评