引言
长视频摘要面临着多模态大型语言模型(MLLMs)的一系列挑战,尤其是在保持长时间段的时间一致性和生成既语义又时间上有依据的摘要方面。为此,我们提出了LVSum,这是一个用于评估长视频摘要的人类注释基准,具备精细的时间对齐。
数据集
LVSum包括72个多样化视频,涵盖13个领域,平均时长为16分钟。每个视频都被注释了多达10个包含时间参考的人类生成摘要。
方法与评估
我们对领先的专有和开源MLLMs进行了全面评估,采用新引入的基于LLM的指标来评估内容相关性和模态一致性,同时也使用了标准的自动化指标。
关键发现
我们的实验揭示了三个关键发现:
- 字幕在摘要质量中的贡献远大于单独的视觉帧;
- 模型生成的摘要与人类撰写的摘要之间存在显著的性能差距;
- 当前的MLLMs在时间基础、指令遵循和跨模态一致性方面表现出系统性弱点。
我们将数据集和代码发布。
博主点评: LVSum基准的提出为长视频摘要领域提供了重要的研究工具,尤其是在强调时间一致性的背景下。面对当前模型的局限性,未来的研究可以集中于如何提高模型在时间和模态之间的协调性,以实现更高质量的摘要生成。