我们提出 PRESLEY,它在先前的 ELVIS 工作基础上进行改进:用可去除性掩码实现自适应的原位降质,取代原来的破坏性块删除;通过比特打包的侧信道传递每块的降质强度;在客户端使用条件化的生成式骨干网络,根据传输的视觉先验而非无条件填补进行恢复。
该系统的核心任务分为三步:① 依据观众关注度选择待降质块;② 以降低编码器比特消耗的方式对这些块进行降质;③ 通过生成式模型在客户端恢复细节。
在匹配码率下,PRESLEY 相比 ELVIS 在 13 条跨码率梯度、多个编解码器和数据集上实现了平均 $-56.4\%$ 的 BD‑rate 降低,背景质量显著提升。与未使用生成式传输的基准相比,PRESLEY 在比特受限场景下可实现最高 $-29.4\%$ 的 BD‑rate 节省,并在 23 条测试序列中有 17 条背景质量更佳,同时前景保持位精确。
为了评估该架构的理论上限,我们使用“留一超块”组合式 Oracle 作为加性经验上界,发现现有的复杂度启发式已捕获约 $83.3\%$ 的比特节省,剩余的比特轴余量约为总码率的 $5\%$。进一步分析表明,恢复后残留的视觉损伤在 $4.9\sim8.4\,\text{dB}$ 之间分布,并且在传输前即可预测(持出相关系数 $\rho=+0.400$),这为传输时的可恢复性建模以及联合率‑失真‑恢复选择规则提供了可行路径。
点评:PRESLEY 展示了生成式 AI 在视频流媒体中的实用价值,尤其在保持前景完整的前提下,大幅削减背景比特开销,为未来的自适应码率控制奠定了基础。