摘要
大型语言模型为端到端驾驶带来了指令跟随和场景推理,但其推理延迟与车辆所需的控制频率存在冲突。现有的闭环代理通过在交替的模拟周期中调用模型,并在两者之间重放先前的命令来隐藏这一差距,从而导致一半的控制输出忽略最新的观察结果。
我们提出了一种快慢架构,消除了这种妥协。一个冻结的7B视觉语言骨干网络作为慢系统,以低频处理导航指令和视觉历史,同时将其每层的键值缓存暴露为场景的静态表示。一个轻量级的行动专家作为快系统,在每个模拟周期关注这个缓存和当前的摄像头帧,以单次前向传播回归航点。
由于缓存在部署时滞后于世界,我们在随机过时的情况下训练专家,使训练与异步执行对齐。在CARLA的LangAuto-Short路线中,我们的系统在每个50毫秒的模拟周期内产生新鲜的控制,将路线完成率从37.0提升到94.0,相较于帧跳过基线。与同一专家进行的帧跳过消融实验分离了两个因素:专家独自提高了驾驶得分,而每个周期的新鲜度将完成率从82.1提升到94.0,并将闯红灯的违规行为减少了三分之一。
在单一城镇上训练的专家零-shot迁移到两个未见过的城镇,保持84-94%的路线完成率,而基线仅达到31-41%。与骨干网络的行动头相比,专家将开放环航点误差减少了近四倍,且在单个消费级GPU上每周期模型成本为32毫秒,与历史长度无关。
博主点评: 这项研究展示了如何利用快慢系统的设计理念,实现高效的闭环驾驶推理。通过有效地处理视觉信息和语言指令,显著提升了驾驶性能,具有广泛的实际应用潜力,尤其在自动驾驶领域的实时决策中具有重要意义。