NeFut Logo NeFut
EN 管理员登录

[AI学术] VLALight:面向紧急车辆的轻量化视觉语言动作模型用于交通信号控制

发布于:2026-09-29 22:00 最后更新:2026-09-30 01:41
#AI #Machine Learning #optimization

交通信号控制(TSC)是缓解城市拥堵的关键技术。近年来,视觉语言模型(VLM)能够对交叉口场景进行更丰富的理解,为基于视觉上下文的 TSC 提供了新思路。然而,传统流水线式的模块耦合方式会在图像‑文本转换过程中丢失细粒度视觉信息,并且顺序推理导致显著的时延。为此我们提出 VLALight——一个轻量级端到端的视觉语言动作框架,直接将交叉口的多视角观测和信号相位信息映射为离散的信号动作。VLALight 将多个方向摄像头的视野合并为统一的视觉输入,并通过文本指令将摄像头视角与交通流向及信号相位对应起来,从而在仅 0.5 B 参数的紧凑模型中实现直接动作预测,无需中间的图像‑文本描述或手工构造的交通状态表示。实验表明,VLALight 在所有对比方法中对紧急车辆的服务效果最佳,紧急车辆的累计等待时间比级联式 VLMLight 下降 21.1%,且能够在本地硬件上实时运行,并对未见过的交叉口拓扑和流量模式保持良好泛化能力。

点评

原文链接: https://arxiv.org/abs/2609.30709

[h] 返回首页