摘要
在机器人感知系统中,多任务学习 (MTL) 支持通过集成语义分割和深度估计来实现全面的 3D 空间场景理解。尽管视觉基础模型 (VFM) 越来越多地被采用作为强大的特征编码器,但现有的解码策略却成为了一个关键瓶颈。为了解决这一问题,我们提出了 DPNeXt,一种简化的多尺度特征融合解码器,是标准密集预测变换器 (DPT) 的高效替代方案。
DPNeXt 使用双深度可分离反向瓶颈,通过以融合为中心的解码和独立任务模块化来提高冻结 VFM 的利用率。为了进一步减轻任务之间的负面归纳迁移,我们引入了多任务边界引导 (MTBG) 策略。与之前的边界感知方法不同,MTBG 应用对称的边界聚焦监督,以鼓励几何一致性,而无需额外的注释或推理成本。
在 Cityscapes 上的实验表明,DPNeXt-S 超越了之前的最先进 (SOTA) MTL 模型,而 DPNeXt-B 进一步提升了整体性能,在比较方法中取得了最佳结果。在 NYUv2 数据集上,DPNeXt-B 也在语义分割和深度估计方面取得了最佳结果,同时所需的可训练参数显著少于之前的大规模 MTL 模型。与标准 DPT 相比,DPNeXt-S 减少了 78.6% 的可训练参数,并在资源受限的笔记本硬件上实现了最快的推理速度。
源代码、模型检查点和演示视频将会在 GitHub 上发布。
博主点评: DPNeXt 通过引入多任务边界引导策略,显著降低了任务间的负迁移,为多任务学习带来了新的思路。其在资源受限环境下的优异表现,展现了轻量级模型设计的重要性,未来在实际应用中值得关注。