NeFut Logo NeFut
EN 管理员登录

[AI学术] D3VL:通过3D时间序列数据与语言模型理解驾驶场景

发布于:2026-07-24 22:00 最后更新:2026-07-26 07:44
#algorithm #AI #Machine Learning

近期,多模态大语言模型(MLLMs)的进展推动了端到端MLLM在自动驾驶中的应用。然而,迄今为止,研究主要集中在使用2D图像和视频的MLLM上。相比之下,本文考虑了使用3D传感器(特别是LiDAR和立体相机)的MLLM有效性。LiDAR在与MLLM整合时面临独特挑战,主要是由于数据稀疏且缺乏网格结构。因此,摄像头和LiDAR数据的融合在MLLM管道中也较为少见。然而,大多数自动驾驶系统依赖于基于LiDAR的感知,整合3D数据已被证明能提升传统3D场景感知任务的性能。

本文提出了D3VL,一个新颖的MLLM框架,能够在一个简单的架构中整合2D和3D时间序列数据。该模型旨在回答涉及交通场景理解和安全性的问题。D3VL在处理2D和3D时间序列数据时,在KITTI问答(QA)数据集上相比基线方法取得了11%的提升。本文还引入了Waymo QA数据集扩展,以评估模型在多样化驾驶条件下处理3D及时间序列数据的能力。D3VL的实现代码和WaymoQA扩展可在我们的补充网站上找到:https://automotivesafety-lvlm.github.io

博主点评: D3VL框架的提出,标志着在自动驾驶领域对3D数据处理的重视,尤其是在LiDAR数据融合方面的创新。通过有效整合2D与3D时间序列数据,D3VL不仅提升了问答系统的性能,还为未来的自动驾驶技术提供了新的思路。其在多样化驾驶场景下的应用潜力值得关注。

原文链接: https://arxiv.org/abs/2607.19528

[h] 返回首页