摘要
自回归视频扩散模型通过去除对未来帧的条件限制,实现了任意长度视频的生成,从而大大提高了计算效率。然而,它们在时间上存在误差累积的问题,去噪序列逐渐偏离训练时观察到的条件分布。最近的进展尝试通过将每个生成帧锚定到真实帧的学习流形上来减少这种误差。
尽管所有生成的单独帧都接近于真实流形,但模型缺乏足够的知识来继续生成一些轨迹,从而导致模型陷入终端点。为防止模型被困在终端点,我们假设对于建模良好的未来轨迹,预测的噪声分布应与前向噪声过程的分布相匹配。为此,我们在测试时引入了通过噪声引导优化实现终端点规避(TANGO),该方法使用扩散模型作为其自身输出的评论者,通过预测一步前的噪声并要求其为各向同性的高斯噪声预测。
我们利用与这一期望噪声分布的偏差来搜索不导致终端点的替代轨迹。我们的方案在VBench上实现了$3.1\\%$的绝对提升,同时在$15$s视频上平均减少了$28.3\\%$的Fréchet视频距离。我们的代码可在 GitHub 上获取。
博主点评: 本文提出的TANGO方法通过噪声引导优化有效解决了自回归视频生成中的终端点问题,展现了在生成模型领域的新思路,值得关注其在实际应用中的潜力与挑战。