在恶劣天气条件下,自动驾驶仍然是一个关键挑战,而现有的视觉-语言基准主要在标准条件、合成损坏或单一模态下进行评估。因此,目前尚不清楚视觉-语言模型在真实世界恶劣天气下的多模态输入表现如何。我们认为,关键的困难在于环境可观测性的降低:在雾、雨、雪和低照明条件下,多模态观察变得不可靠且跨模态不一致,这对场景理解和后续决策造成挑战。为了研究这一点,我们引入了 ObsDriveBench,一个针对恶劣天气下自动驾驶的真实多模态基准。我们的基准设计了三个能力维度:可观测性意识、空间可靠性和风险意识决策,以便对模型在降级观察下的行为进行细致诊断。我们通过可观测性元注释、场景描述和基于能力的多项选择任务构建了该基准,涵盖同步的摄像头、LiDAR和雷达输入,形成了一个包含超过14k训练和13k测试问题的基准。实验结果显示,现有视觉-语言模型的性能一致下降。我们进一步引入了 ObsDrive 模型,通过正常天气的监督微调和恶劣天气的强化学习,提高了在所有三项能力上的鲁棒性。数据集和评估代码将会发布在 ObsDriveBench。
博主点评: 该研究针对自动驾驶领域内的一个重要问题,即如何在恶劣天气下进行有效的多模态理解,提供了创新的解决方案。ObsDriveBench不仅丰富了现有的基准测试,还通过细致的可观测性分析为未来的研究提供了重要的方向。