NeFut Logo NeFut
EN 管理员登录

[AI学术] VANTAGE-Bench:评估视觉语言模型在基础设施 AI 方面的差距

发布于:2026-09-12 22:00 最后更新:2026-09-15 01:15
#AI #Machine Learning #Vision-Language

VANTAGE-Bench 是首个专门衡量视觉语言模型(VLM)在基础设施 AI 场景下表现的基准。基础设施 AI 依赖固定摄像头提供开放回路的安全监控、运营记录等信息,区别于以主体为中心的消费视频任务。

该基准覆盖物流、交通和智慧空间三大运营域,统一了图像与视频的评估维度,包括语义、空间、时间以及时空四个层面。任务形式从传统的多项选择扩展到八类,包括密集字幕(dense captioning)和时空定位(spatio-temporal grounding),并引入单通道轨迹协议用于单目标跟踪(Single Object Tracking),这是首次在固定摄像头基础设施视频上进行此类评估,并与专业跟踪器进行对标。

标注工作覆盖 3,346 条媒体资产,具体包括 3,342 条视频任务标注、4,281 条图像定位标注以及 27,404 个检测框。我们对 17 种模型进行零样本评估,发现相较于面向消费场景的基准,性能缺口呈现集中而非全局的特征。事件验证、指代表达和时间定位的得分下降约 9~24 分,而视频问答(VideoQA)仅比 VideoMME 低 5.3 分,二维空间指向任务与 BLINK 持平,无明显短板。

在时间维度上表现最弱:最高的时间定位 mIoU 仅为 55.7%,密集视频字幕的 SODA_c 最高为 37.3%。跟踪任务中,前沿模型在短时程内与专业跟踪器相差约 5 分,但随时间延长差距显著扩大。值得注意的是,开放权重模型在二维目标定位上整体领先,说明模型规模或专有访问权并非导致差距的根本原因。

数据、评估代码及排行榜已公开:https://vantage-bench.org/

点评

原文链接: https://arxiv.org/abs/2609.09396

[h] 返回首页