大型视频扩散模型提供了丰富的先验用于具身预测和学习,但其多步采样在交互式下游任务中代价高昂。分布匹配蒸馏(DMD)能够实现少步视频生成,却可能抑制机器人与物体的运动,同时保持视觉质量。通过分析 DMD 的教师信号和伪得分(fake‑score)信号,我们发现弱再噪声(re‑noising)使教师后验集中在缺乏运动的 rollout 上,限制了恢复运动的引导;而运动强烈的 rollout 往往产生更大的伪得分拟合误差,阻碍生成器学习交互动态。
为此我们提出 DyMD,一个自适应教师监督和评论器(critic)拟合的 DMD 框架。时间亲和(temporal affinity)条件再噪声采样根据每个 rollout 当前的交互保真度混合基础时间表和受局部后验变化驱动的教师先验,从而在运动恢复和外观细化之间取得平衡。为了更好地跟踪运动强烈的 rollout,动态引导的伪得分跟踪使用噪声条件预测器估计潜在时间动态相对噪声的拟合难度,并在评论器损失中对预测困难的 rollout 加权。
使用 DyMD,我们在不增加推理时辅助模块的前提下,将 14B 教师蒸馏为四步 1.3B 学生模型。在具身视频基准上,学生模型相较于基础 DMD 在 R‑Bench 任务遵循度提升 $9.6$ 百分点,PAI‑Bench‑G 域分数提升 $5.1$ 分,且视觉质量相当。作为下游动作规划的骨干,学生模型在两个 WorldArena 任务上的平均成功率为 34%,而基础 DMD 为 16%。
点评