NeFut Logo NeFut
EN 管理员登录

[AI学术] DART:面向少步视频扩散模型的无训练 LoRA 重用蒸馏感知再参数化

发布于:2026-09-18 22:00 最后更新:2026-09-20 12:54
#AI #Machine Learning #optimization

本文提出 DART,一种在不进行额外训练的前提下,使 LoRA 在更短的去噪步数下仍保持功能的再参数化方法。传统的 step distillation 通过减少视频生成步数降低计算成本,但直接复用在长轨迹上训练的 LoRA 往往导致功能偏移或质量下降。我们观察到,即使在几何度量上相似,不同的适配器在缩短的去噪调度下仍会表现出不同的行为,这说明仅靠静态参数兼容性不足以解释问题。

DART 的核心包括两部分:① 低秩坐标传输(low‑rank coordinate transport),将源 LoRA 的参数映射到目标调度的坐标空间;② 目标调度响应校准(target‑schedule response calibration),通过前向评估在目标步数上测量输出并进行校正,无需源视频或额外训练。校准过程使用前向传播的误差 $\Delta = f_{\text{target}}(x) - f_{\text{source}}(x)$ 进行线性调整。

在四步 Wan2.2 目标上,DART‑F 将联合质量分数从 $0.9029$ 提升至 $0.9227$,宏观功能保留从 $-0.4644$ 改为 $+0.1349$。组件分析表明,校准贡献了大部分提升,坐标传输在与校准结合时提供了额外增益。适配器层面的实验显示,部分适配器的正向功能得到增强,而负向功能显著减弱。对另外两个目标的评估同样呈现出整体提升趋势。

这些结果表明,在评估蒸馏模型的 LoRA 重用时,应同时考虑功能保留和负迁移的避免,而不必假设每个适配器都能完全恢复原有性能。

点评

原文链接: https://arxiv.org/abs/2609.20051

[h] 返回首页