NeFut Logo NeFut
EN 管理员登录

[AI学术] DPNeXt:轻量级多尺度特征融合框架,提升ViT基础的多任务密集预测效率

发布于:2026-07-21 22:00 最后更新:2026-07-22 01:01
#AI #Machine Learning #optimization

摘要

在机器人感知系统中,多任务学习 (MTL) 支持通过集成语义分割和深度估计来实现全面的 3D 空间场景理解。尽管视觉基础模型 (VFM) 越来越多地被采用作为强大的特征编码器,但现有的解码策略却成为了一个关键瓶颈。为了解决这一问题,我们提出了 DPNeXt,一种简化的多尺度特征融合解码器,是标准密集预测变换器 (DPT) 的高效替代方案。

DPNeXt 使用双深度可分离反向瓶颈,通过以融合为中心的解码和独立任务模块化来提高冻结 VFM 的利用率。为了进一步减轻任务之间的负面归纳迁移,我们引入了多任务边界引导 (MTBG) 策略。与之前的边界感知方法不同,MTBG 应用对称的边界聚焦监督,以鼓励几何一致性,而无需额外的注释或推理成本。

在 Cityscapes 上的实验表明,DPNeXt-S 超越了之前的最先进 (SOTA) MTL 模型,而 DPNeXt-B 进一步提升了整体性能,在比较方法中取得了最佳结果。在 NYUv2 数据集上,DPNeXt-B 也在语义分割和深度估计方面取得了最佳结果,同时所需的可训练参数显著少于之前的大规模 MTL 模型。与标准 DPT 相比,DPNeXt-S 减少了 78.6% 的可训练参数,并在资源受限的笔记本硬件上实现了最快的推理速度。

源代码、模型检查点和演示视频将会在 GitHub 上发布。

博主点评: DPNeXt 通过引入多任务边界引导策略,显著降低了任务间的负迁移,为多任务学习带来了新的思路。其在资源受限环境下的优异表现,展现了轻量级模型设计的重要性,未来在实际应用中值得关注。

原文链接: https://arxiv.org/abs/2607.16012

[h] 返回首页