运行时故障监控器可以利用模型内部表征来预测失败。本文在两个自动驾驶任务上审计了这种监控策略:使用 LaneSegNet 的在线矢量化地图生成以及使用 VAD 的端到端规划。实验表明,帧级错误在推理阶段是可预测的。
对于 LaneSegNet,采用监督的潜在探针能够以 $AUROC=0.780$ 检测高 Chamfer 误差,这是首次针对在线矢量化地图生成的后置帧级故障监控。对于 VAD,监督的规划潜在探针在平均 ADE 失效上达到 $AUROC=0.868$。
进一步审计发现,强大的故障预测并不依赖内部表征。仅使用 LaneSegNet 的预测输出即可获得 $AUROC=0.825$;而在 VAD 场景下,仅利用自车状态、驾驶指令和规划器预测轨迹即可在相同的平均 ADE 端点上达到 $AUROC=0.924$。向这两个基线加入潜在特征并未带来统计显著的提升。该结论在一系列规划失效端点上均成立,即使这些端点的标签依赖于非潜在基线不可见的几何信息。
因此,仅凭内部表征预测故障并不能证明该表征提供了超出可观测输入输出的有用信息。本文提出了一套评估协议用于测试潜在访问的增量价值,并公开了每帧的失效端点标签。
点评