NeFut Logo NeFut
EN 管理员登录

[AI学术] MVVBench:面向视觉语言模型的4D推理基准

发布于:2026-09-29 22:00 最后更新:2026-09-30 01:41
#AI #Machine Learning #Neural

多视角视频理解需要在多个往往不重叠的摄像头流之间整合空间和时间信息:跟踪实体在视角切换中的轨迹、对齐跨时序的事件,并推理潜在的4D连续性,而不是仅凭单帧可见内容。我们推出 MVVBench,这是一套基于真实多摄像头数据集构建的多视角视频推理基准。每个问题在视角和时间维度上都对单目信息构成歧义:在指定的输入集合中,任何单一视角都无法作答,且大多数问题在单一时刻也无法解答。只有同时跨视角、跨时间进行推理时,问题才唯一可解。MVVBench 覆盖多种动态场景,检验六项能力——隐式/显式属性识别、隐式/显式相对距离、相对摄像头姿态以及组合计数,全部由人工编写问答并经过严格验证。除了基准本身,我们对现有视觉语言模型的成功与失败进行深入分析,指出错误主要来源于时间定位偏差、跨视角身份断裂以及脆弱的多跳推理。随后我们探索了推理阶段的激活策略:任务特定的思路链(chain‑of‑thought)模板和结构化的跨视角证据聚合,在不重新训练的前提下显著提升性能。初步实验表明,使用可验证奖励的强化学习也能唤醒模型的潜在多视角能力,暗示训练阶段的改进是未来的有力方向。总体而言,MVVBench 为4D多视角推理提供了严格评估平台,并为实现可靠的具身感知奠定了基础。

点评:MVVBench 将视角与时间的双重模糊设为核心挑战,凸显了当前视觉语言模型在跨模态、跨时空推理上的局限,同时提供了清晰的评估路径和可行的提升手段,为后续研究指明了方向。

原文链接: https://arxiv.org/abs/2609.30952

[h] 返回首页