NeFut Logo NeFut
EN 管理员登录

[AI学术] AgentVidBench:用于评估多模态大语言模型代理的多跳视频问答基准

发布于:2026-09-22 22:00 最后更新:2026-09-24 00:40
#AI #Machine Learning #LLM

综合视频理解是推动人工智能走向真实物理世界复杂动态的关键。近期多模态大语言模型(MLLM)在视频理解上取得显著进展,但现有基准大多局限于单步场景查询或全局摘要,无法覆盖真实场景中需要多跳多模态推理的任务。为填补这一空白,我们推出 AgentVidBench——一个聚焦空间、时间和因果推理的多跳视频问答基准。除了传统的问答对,基准还提供逐步解题轨迹,用于评估模型是否显式获取并利用证据来支撑答案。我们在 12 种商业和开源 MLLM 上进行实验,发现单轮表现仍然受限,而将模型嵌入最新的代理工作流后,准确率和轨迹得分均有提升。我们进一步提出一种简洁但有效的代理策略,作为基准的竞争基线,展示了 AgentVidBench 作为面向代理视频理解的整体测试平台的价值。代码与数据集已公开: https://github.com/krafton-ai/agentvidbenchhttps://huggingface.co/datasets/agentvidbench/agentvidbench

点评

原文链接: https://arxiv.org/abs/2609.21386

[h] 返回首页