NeFut Logo NeFut
EN 管理员登录

[AI学术] 革命性模块化动态粒度视频LLM推动长视频多事件理解

发布于:2026-07-21 22:00 最后更新:2026-07-22 01:01
#AI #Reinforcement Learning #Video LLM

摘要

视频大型语言模型(Video LLMs)在各种视频理解任务中取得了显著进展。然而,长视频场景仍然具有挑战性,因为有限的视觉标记预算与捕捉多个关键事件之间存在矛盾。现有方法通常将长视频处理分为两个阶段:选择关键帧和进行详细感知,这种方法存在局限性:缺乏自适应能力分配和自我校正的模块化机制,导致建模不可靠。

为了解决这些挑战,我们提出了MoD-VLLM,一种新颖的模块化动态粒度视频LLM框架,用于多事件长视频理解。该框架以迭代和自反的方式统一时间定位和语义理解。具体而言,我们提出了一个正负视频片段定位模块和一个模块化动态粒度反思模块,这两个模块形成一个闭环,逐步定位与问题相关的视频片段。

定位模块指导视频LLM根据视频问题区分相关和不相关的视频片段。反思模块采用模块化调度器,动态选择对相关正片段进行细粒度编码,以捕捉详细感知,而对负片段进行粗粒度编码,以保持全局上下文。我们进一步提出了一种动态粒度强化学习策略,使MoD-VLLM能够共同学习最佳定位策略和动态粒度视觉表示。此外,我们还提出了MEventBench,一个具有挑战性的多事件长视频基准,用于复杂的长视频推理。在多个长视频理解基准和我们的MEventBench上进行了广泛实验,结果表明MoD-VLLM显著优于现有的最先进基线。

博主点评: MoD-VLLM的提出显著提升了长视频理解的能力,通过模块化设计和动态粒度调度,解决了传统方法在多事件捕捉中的不足,展现了未来视频分析技术的广阔前景。其引入的MEventBench也为后续研究提供了良好的评估基准。

原文链接: https://arxiv.org/abs/2607.15778

[h] 返回首页