NeFut Logo NeFut
EN 管理员登录

[AI学术] CapMem:基于字幕的自我视角视频情景记忆基准

发布于:2026-09-17 22:00 最后更新:2026-09-18 00:46
#algorithm #AI #Machine Learning

可穿戴助手需要在自我视角视频上具备情景记忆能力,但现有视觉语言模型受限于帧数预算、视觉令牌成本上升以及长上下文检索失败等实际约束。我们探讨文本字幕能否作为可复用的情景记忆。为此我们定义了 Episodic Memory Video Caption QA 任务,并推出了 CapMem 基准——该基准包含 75 段视频,总时长 33.7 小时,配备 1,000 道多项选择题,覆盖 16 种日常场景。实验在时长约 20 分钟的长视频上进行,使用 30 秒和 60 秒的字幕窗口进行全覆盖 CaptionQA,分别在 12 种模型中有 10 种和 8 种模型的准确率超过直接 VideoQA。对比同帧控制实验,在六个 Qwen 系列模型上平均提升 3.22 分和 2.55 分。进一步引入基于字幕的检索‑验证流程,可额外提升最高 5.3 分。结果表明,字幕记忆在长时自我视角视频的情景推理中具备显著效用。

点评:CapMem 通过大规模人工标注展示了字幕作为轻量记忆介质的可行性,为未来在资源受限环境下的长视频理解提供了新的思路。

原文链接: https://arxiv.org/abs/2609.17688

[h] 返回首页