NeFut Logo NeFut
EN 管理员登录

[AI学术] CoRe:协同进化奖励模型以缓解视频扩散模型的潜在奖励攻击

发布于:2026-09-30 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #optimization

潜在奖励模型(LRM)通过在潜在空间直接为视频扩散模型的中间状态打分,实现了高效对齐。然而,固定奖励模型的优化会迅速导致潜在奖励攻击:模型的预测奖励保持高位,但感知质量和运动连贯性急剧下降。

我们分析发现,核心原因是分布逃逸(distributional escape)。在数百次更新后,生成器的输出已超出奖励模型的训练支持范围,此时奖励分数不再反映真实视频质量。

基于此认识,提出 CoRe 框架,将潜在空间对齐视为生成器与奖励模型的动态交互。CoRe 不再针对静态代理进行优化,而是持续在生成器当前样本上重新拟合奖励模型,并将其锚定到真实视频偏好上,防止生成器通过偏离数据分布来获取高奖励。

在 Wan2.1‑T2V‑1.3B 上的实验表明,CoRe 相较于预训练模型和已有对齐方法,能够持续提升生成质量,同时避免固定奖励优化导致的质量崩塌。

点评:CoRe 通过让奖励模型随生成器共同演化,有效抑制了分布漂移带来的奖励欺骗,为视频生成对齐提供了更稳健的路径。

原文链接: https://arxiv.org/abs/2609.36245

[h] 返回首页