近期 Video‑LLM 在视频理解上取得显著进展,但现有评测多依赖问答或与人工字幕的匹配,模型往往凭借表层线索或不完整标注获得高分,难以真实衡量细粒度理解能力。为此我们构建了 VidOmni‑Bench——一个要求模型逐句验证密集字幕中每个事件是否得到视频支撑的基准。
VidOmni‑Bench 包含 500 条视频,覆盖五种复杂度类型,时长从 4 秒到 90 分钟不等。我们先按复杂度和时长采集视频,再使用多种 Video‑LLM 生成密集字幕,随后人工对每句进行真伪标注。标注为错误的句子被视为硬负例,用于评估模型的验证能力。
在该基准上的实验得到三点主要发现:
- 在密集字幕生成阶段,Video‑LLM 常出现幻觉式描述,即生成与视频内容不符的事件。
- 作为验证器时,模型难以可靠识别看似合理却错误的事件描述,误判率较高。
- 模型的薄弱环节随视频复杂度和时长而异,不同模型在不同维度上表现出独特的瓶颈。
这些结果表明,细粒度、跨时长的视频理解仍是 Video‑LLM 的关键挑战,需要在生成准确性和验证鲁棒性上同步提升。
点评