综合视频理解是推动人工智能走向真实物理世界复杂动态的关键。近期多模态大语言模型(MLLM)在视频理解上取得显著进展,但现有基准大多局限于单步场景查询或全局摘要,无法覆盖真实场景中需要多跳多模态推理的任务。为填补这一空白,我们推出 AgentVidBench——一个聚焦空间、时间和因果推理的多跳视频问答基准。除了传统的问答对,基准还提供逐步解题轨迹,用于评估模型是否显式获取并利用证据来支撑答案。我们在 12 种商业和开源 MLLM 上进行实验,发现单轮表现仍然受限,而将模型嵌入最新的代理工作流后,准确率和轨迹得分均有提升。我们进一步提出一种简洁但有效的代理策略,作为基准的竞争基线,展示了 AgentVidBench 作为面向代理视频理解的整体测试平台的价值。代码与数据集已公开: https://github.com/krafton-ai/agentvidbench 与 https://huggingface.co/datasets/agentvidbench/agentvidbench。
点评