NeFut Logo NeFut
EN 管理员登录

[AI学术] 感知细化的端到端视频流管线 via 生成式 AI 层

发布于:2026-09-19 22:00 最后更新:2026-09-20 12:54
#AI #Machine Learning #optimization

我们提出 PRESLEY,它在先前的 ELVIS 工作基础上进行改进:用可去除性掩码实现自适应的原位降质,取代原来的破坏性块删除;通过比特打包的侧信道传递每块的降质强度;在客户端使用条件化的生成式骨干网络,根据传输的视觉先验而非无条件填补进行恢复。

该系统的核心任务分为三步:① 依据观众关注度选择待降质块;② 以降低编码器比特消耗的方式对这些块进行降质;③ 通过生成式模型在客户端恢复细节。

在匹配码率下,PRESLEY 相比 ELVIS 在 13 条跨码率梯度、多个编解码器和数据集上实现了平均 $-56.4\%$ 的 BD‑rate 降低,背景质量显著提升。与未使用生成式传输的基准相比,PRESLEY 在比特受限场景下可实现最高 $-29.4\%$ 的 BD‑rate 节省,并在 23 条测试序列中有 17 条背景质量更佳,同时前景保持位精确。

为了评估该架构的理论上限,我们使用“留一超块”组合式 Oracle 作为加性经验上界,发现现有的复杂度启发式已捕获约 $83.3\%$ 的比特节省,剩余的比特轴余量约为总码率的 $5\%$。进一步分析表明,恢复后残留的视觉损伤在 $4.9\sim8.4\,\text{dB}$ 之间分布,并且在传输前即可预测(持出相关系数 $\rho=+0.400$),这为传输时的可恢复性建模以及联合率‑失真‑恢复选择规则提供了可行路径。

点评:PRESLEY 展示了生成式 AI 在视频流媒体中的实用价值,尤其在保持前景完整的前提下,大幅削减背景比特开销,为未来的自适应码率控制奠定了基础。

原文链接: https://arxiv.org/abs/2609.19215

[h] 返回首页