时空视频定位(STVG)旨在根据自然语言查询在视频中定位对应的时空轨迹。近期方法在全监督、弱监督和零样本设置下取得了不错的效果,但往往依赖计算量大的网络、复杂的训练流程或多模态大语言模型。Pocket‑STVG(P‑STVG)提出了一种轻量级级联架构,通过组合高效的预训练模块而非大型端到端模型来完成 STVG 任务。\ \ P‑STVG 包含三大核心组件:基于 MobileViCLIP 的时序感知视频编码器、源自 MDETR 的空间编码‑解码器,以及共享的对齐文本编码器。时序定位可通过轻量的 1D U‑Net 或简单的阈值策略实现,使同一框架能够在弱监督和零样本两种场景下工作。\ \ 视频特征在查询之前即可独立预计算,形成可索引的表示,从而实现高效推理并适配大规模视频库。模型参数不足 90M,却在弱监督基准上与现有方法持平,并在零样本设置上超越早期方案,显著降低了内存和计算开销,展示了 STVG 任务的性能‑效率平衡。\ \ 点评:Pocket‑STVG 通过模块化设计和预计算策略,成功在保持精度的前提下降低资源需求,为实际部署提供了可行路径。