摘要
测试时搜索让小型视频扩散模型能够与大型模型竞争,但其成本高达2-10倍。所有候选项都经过完全去噪,尽管大多数会被丢弃。无训练的缓存使每次生成速度提升2-3倍,且质量几乎无损。只有在有损缓存保留验证者排名的情况下,组合才是安全的。我们首次研究了缓存是否会破坏视频测试时搜索中的候选排名。
在Wan2.1-T2V-1.3B模型上,采用适应性缓存包装器实现了每个候选项约2倍的速度提升,ImageReward评分显示缓存的和完整生成的结果匹配。每个提示的中位Spearman排名相关系数为0.905,VBench套件上72%的前1名一致性。VBench-2.0在更难的测试集上复制了这一结果。重新计算缓存胜者时,保持90-94%的完整搜索增益。错误往往集中在接近平局的候选项中,导致破坏自我限制。这一发现促成了CachedSearch的提出。
CachedSearch以激进的缓存方式探索每个候选项,然后仅在完整计算下重新生成胜者。在N=8时,它可以以63%的成本捕获94.7%的最佳N增益。随着宽度的增加,捕获率上升。在匹配预算下,它以更宽的搜索范围获得38%的增益。该结果在1.3B-14B的六个模型和四个系列中均保持一致:Wan、LTX、CogVideoX和Hunyuan。Wan2.1-14B的保真度与1.3B模型匹配。中途修剪将探索节省提升至3.11倍,捕获率为88.6%。移植到其他模型系列只需重新校准一个参数,表明保真度与架构相关,而非参数数量。
CachedSearch是无训练的、与验证者无关的,并且与搜索算法正交,使其成为测试时扩展的插件增益工具。
博主点评: CachedSearch的创新之处在于其无训练的特性和高效的缓存策略,极大地提高了视频生成模型的测试时性能。这种方法在节省计算资源的同时,保持了高质量的生成结果,展示了在模型架构优化方面的潜力。未来,随着模型规模的扩大,CachedSearch有望在更多应用场景中发挥作用。