NeFut Logo NeFut
EN 管理员登录

[AI学术] OSVE:一步到位的视频编辑新纪元

发布于:2026-07-24 22:00 最后更新:2026-07-26 07:44
#algorithm #AI #Open Source

引言

文本引导的视频编辑在扩散模型的应用中通常速度缓慢,受到多步采样和反演过程的限制。为此,我们提出了OSVE,这是第一个成功将一步文本到图像(T2I)模型适用于高质量视频编辑的框架,解决了反演、可编辑性和时间一致性等核心挑战。

关键技术

为了绕过缓慢的迭代反演,我们训练了一个可学习的编码器,它能够在一次前向传递中预测每帧的初始噪声。该编码器是基于一种新颖的结构感知编辑(SAE)损失进行训练的,使用了一组结构对齐的图像对数据集,这样可以在编辑过程中保持源视频的几何结构。

为了实现时间一致性,我们引入了统一帧编辑(UFE)技术,该技术将帧潜在表示连接起来,以便在单次生成步骤中实现跨帧注意力。此外,对于长视频,使用滑动窗口策略和锚帧来保持全局一致性。

我们的广泛实验表明,OSVE在编辑质量上与最先进的多步方法相当或更优,同时速度约为155至171倍更快。这一突破为实用的实时视频编辑应用铺平了道路。

代码可在 GitHub 上获取。

博主点评: OSVE框架通过创新的编码器和编辑技术,极大地提升了视频编辑的效率和质量,展示了扩散模型在实际应用中的巨大潜力。这一进展不仅为视频创作者提供了更强大的工具,也可能引领视频编辑行业的变革。

原文链接: https://arxiv.org/abs/2607.19895

[h] 返回首页