摘要
时空视频定位 (STVG) 旨在从视频流中检索特定对象的视觉轨迹,该轨迹由自然语言表达描述。然而,大多数先进方法在全球上下文建模和精确边界定位之间难以取得平衡。由于处理长视频的计算成本高昂,这些方法通常依赖低频率时间下采样和隐式运动建模。这不可避免地抑制了高频边界线索,并忽略了精确边界描绘所需的显式帧间依赖关系。
为了解决这些限制,我们提出了 ScanFocus,一种新的粗到细框架,将 STVG 任务解耦为全局时空扫描和局部边界聚焦。具体来说,我们利用一个统一的视觉-语言融合编码器,并结合轻量级的可变形语义-运动融合模块,以高效对齐多模态特征并生成粗略提案。为了恢复抑制的细粒度细节,我们在细化阶段引入了语义引导时间聚合器 (SGTA)。通过在粗边界周围进行密集采样,SGTA 在语义引导下显式建模短期时间交互,捕捉快速运动变化以实现精确的时间戳回归。对三个广泛使用的基准进行的广泛实验表明,我们提出的方法在性能上优于以前的方法。
代码将发布在 GitHub。
博主点评: ScanFocus 的粗到细策略有效克服了传统 STVG 方法的局限性,通过引入语义指导的时间聚合,显著提升了边界定位的精度。这一创新框架在大规模视频处理中的潜力不容小觑,值得关注。