交通信号控制(TSC)是缓解城市拥堵的关键技术。近年来,视觉语言模型(VLM)能够对交叉口场景进行更丰富的理解,为基于视觉上下文的 TSC 提供了新思路。然而,传统流水线式的模块耦合方式会在图像‑文本转换过程中丢失细粒度视觉信息,并且顺序推理导致显著的时延。为此我们提出 VLALight——一个轻量级端到端的视觉语言动作框架,直接将交叉口的多视角观测和信号相位信息映射为离散的信号动作。VLALight 将多个方向摄像头的视野合并为统一的视觉输入,并通过文本指令将摄像头视角与交通流向及信号相位对应起来,从而在仅 0.5 B 参数的紧凑模型中实现直接动作预测,无需中间的图像‑文本描述或手工构造的交通状态表示。实验表明,VLALight 在所有对比方法中对紧急车辆的服务效果最佳,紧急车辆的累计等待时间比级联式 VLMLight 下降 21.1%,且能够在本地硬件上实时运行,并对未见过的交叉口拓扑和流量模式保持良好泛化能力。
点评