NeFut Logo NeFut
EN 管理员登录

[AI学术] 颠覆传统的视频编码:隐式神经表示的应用

发布于:2026-07-20 22:00 最后更新:2026-07-22 01:02
#AI #optimization #Open Source

摘要

传统的编码器通过压缩像素数据来存储视频,而我们的方法则将视频及其音频轨道作为一个单一的正弦表示网络(SIREN)的权重来存储,该网络将时空坐标映射到RGB值和音频幅度。

该网络使用独立的音频和视频初始化层,堆叠共享的全连接隐藏层,并设有三个输出分支:一个用于视频,两个Siamese音频分支,其不一致性用于估计和减去残余噪声。过拟合的教师网络随后通过基于响应的知识蒸馏压缩为一个更小的学生网络,接着进行16位对称权重量化和无损LZMA2 (xz) 编码。

在一个6.08 MiB的测试视频上,量化后的学生网络达到了28.72 dB的视频PSNR和0.75的SSIM,以及24.18 dB的音频PSNR和10.69 dB的对数谱距离,同时该管道将表示从9.05 MiB缩小到2.33 MiB,整体压缩比为2.61。

通过1位到32位量化的位宽扫描显示,重建质量在16位时趋于饱和。我们对比了H.264、HEVC和MP3,报告了该方法在何处落后,并描述了一个基于浏览器的原型,该原型通过WebRTC训练、传输和解码这些模型。

博主点评: 本文提出了一种创新的视频编码方案,利用隐式神经表示显著提高了压缩效率。通过知识蒸馏和量化技术,有效降低了存储需求,适合现代网络传输需求,具有广泛的应用前景。此方法在视频和音频质量上虽有待提升,但为未来的多媒体编码奠定了基础。

原文链接: https://arxiv.org/abs/2607.15298

[h] 返回首页