NeFut Logo NeFut
EN 管理员登录

[AI学术] 革命性FlashDecoder:基于Transformer的实时视频解码器

发布于:2026-07-18 22:00 最后更新:2026-07-22 01:03
#AI #Machine Learning #optimization

在实时视频生成中,快速解码与快速去噪同样重要。然而,当前的潜在视频扩散模型依赖于3D卷积解码器,这在高分辨率或长视频时速度慢且内存消耗大。

我们介绍了FlashDecoder,这是一种快速且内存高效的纯Transformer视频解码器,能够逐帧解码潜在图像。在每个步骤中,当前帧仅关注一个固定大小的过去帧窗口,通过滚动的KV缓存来实现。

固定的时间窗口确保了解码过程的快速性和内存限制,无论视频长度如何,从而实现了恒定延迟的流媒体传输。

由于帧是按顺序处理的,时间因果关系得以维护,无需显式的注意力掩码,使得训练分辨率高达1080p,并且重构质量可与卷积解码器相媲美。

在Wan2.1和Wan2.2潜在空间中,FlashDecoder在重构质量上与每个卷积解码器相当(例如,在1080p下,41.55dB对比41.49dB PSNR),同时在单个H100 GPU上解码速度快3.6到4.7倍,内存使用量减少高达11倍。通过架构感知的推理优化,速度提升进一步扩大至12倍。

博主点评: FlashDecoder的推出标志着视频解码领域的一次重要进步,尤其是在高分辨率和长视频处理方面。其基于Transformer的设计不仅提高了速度和内存效率,也为后续研究提供了新的思路,值得关注和深入探索。

原文链接: https://arxiv.org/abs/2607.14898

[h] 返回首页