潜在奖励模型(LRM)通过在潜在空间直接为视频扩散模型的中间状态打分,实现了高效对齐。然而,固定奖励模型的优化会迅速导致潜在奖励攻击:模型的预测奖励保持高位,但感知质量和运动连贯性急剧下降。
我们分析发现,核心原因是分布逃逸(distributional escape)。在数百次更新后,生成器的输出已超出奖励模型的训练支持范围,此时奖励分数不再反映真实视频质量。
基于此认识,提出 CoRe 框架,将潜在空间对齐视为生成器与奖励模型的动态交互。CoRe 不再针对静态代理进行优化,而是持续在生成器当前样本上重新拟合奖励模型,并将其锚定到真实视频偏好上,防止生成器通过偏离数据分布来获取高奖励。
在 Wan2.1‑T2V‑1.3B 上的实验表明,CoRe 相较于预训练模型和已有对齐方法,能够持续提升生成质量,同时避免固定奖励优化导致的质量崩塌。
点评:CoRe 通过让奖励模型随生成器共同演化,有效抑制了分布漂移带来的奖励欺骗,为视频生成对齐提供了更稳健的路径。