摘要
尽管多模态大语言模型(MLLMs)在基本视频任务上展现出卓越的泛化能力,但受限的上下文窗口限制了其对长视频的理解。为了解决这一问题,模型通常依赖于关键帧选择。然而,均匀采样或静态查询引导的选择往往忽视了重要的时间上下文,未能适应不同查询时间粒度的变化。
在本文中,我们提出了 ReMem,一个针对训练无关的长视频问答(LongVideoQA)的时间粒度自适应关键帧选择框架。ReMem 引入了双层记忆增强适应机制:
- 查询级别:记忆驱动的问题解析利用 LLM 的长期记忆解码问题的时间粒度并提取语义实体。
- 视频级别:协同双语义帧对齐利用内在结构记忆对齐帧与查询语义,指导结构感知动态帧路由以聚类事件并优化采样预算。
通过显式保留时间信息的记忆机制,ReMem 减少了冗余,使 MLLMs 能够进行强大的多粒度视频推理。在对四个流行的 LongVideoQA 基准的评估中,使用三种 MLLMs 展现出高效的、先进的零-shot 性能;值得注意的是,LLaVA-Video 搭配 ReMem 在 LVBench 上达到了 54.5%(+12.3%)和在 LongVideoBench 上达到了 67.1%(+8.2%)。
博主点评: ReMem 框架通过引入记忆机制,成功解决了长视频理解中的时间粒度问题,展现出强大的适应性和高效性。未来,这种方法有望推动视频理解技术的进一步发展,尤其是在复杂场景下的应用。