NeFut Logo NeFut
EN 管理员登录

[AI学术] GHR-VLM:实现零-shot公交视频分析的混合推理框架

发布于:2026-07-17 22:00 最后更新:2026-07-18 08:19
#algorithm #AI #Open Source

在公交视频理解领域,传统的乘客计数器和收费系统无法捕获的细粒度数据具有重要价值。然而,监督视频模型需要特定任务的标注,而将视觉语言模型(VLMs)直接应用于长时间的车载视频则不可靠且成本高昂。为此,我们提出了GHR-VLM,这是一种用于零-shot公交视频分析的视觉基础混合推理框架。该框架的设计灵感来源于显式视觉基础可以通过将长时间监控流转换为紧凑的乘客中心时空证据来提升VLM推理的效果。

具体而言,我们提出了一种边缘-云设计,其中轻量级的边缘监控器持续跟踪车门状态并分割乘客片段。后端的VLM负责识别登车乘客,并通过时空证据的粗到细的两阶段细化过程对支付行为进行分类。通过仅在基础乘客片段和接触表上调用VLM,GHR-VLM减少了云端推理,避免了支付特定的训练数据,并提供了VLM通常难以识别的本地化证据。对486分钟的真实公交监控视频的评估展示了基础边缘-云推理在乘客级支付分析中的潜力,同时突显了退化视频条件带来的挑战。

博主点评: GHR-VLM通过结合边缘计算和视觉语言模型,显著提高了公交视频分析的效率和准确性。这一方法不仅节省了计算资源,还能在缺乏大量标注数据的情况下,提升模型的实用性,具有重要的应用价值。实际评估结果也表明了该方法在复杂环境下的适应性,值得进一步研究和推广。

原文链接: https://arxiv.org/abs/2607.13569

[h] 返回首页