摘要
近年来,扩散模型已成为单目深度估计(MDE)的主流方法。然而,这些模型隐含地假设深度可以通过迭代去噪恢复为一个全局平滑的场,这并未明确反映场景几何的分段和尺度依赖性组织。
实际上,几何结构是通过空间尺度逐步显现的,其中粗略布局、表面和边界以层次化方式构建。
基于这一观察,我们提出了ARDepth,将深度估计公式化为结构化自回归生成。与其通过全局优化恢复深度,ARDepth逐步构建深度表示,随着空间分辨率的提高而增强。
为支持这一生成过程,我们引入了尺度渐进条件(SPC),在每个生成阶段注入多尺度视觉特征,以及语义感知引导(SAG),提供场景级语义先验,以增强全局结构一致性。
这些设计使得模型能够捕捉细粒度的局部细节,同时保持一致的全局几何。实证结果表明,我们的方法在各个尺度上都能实现强大的性能,并生成结构一致的深度预测,验证了自回归生成作为几何建模的有前景的替代范式。
博主点评: ARDepth通过引入逐步生成和多尺度条件,使深度估计在捕捉局部细节与全局结构之间取得了良好平衡。这种自回归生成的方法不仅提升了深度估计的准确性,还为未来的几何建模提供了新的思路,值得在更广泛的应用中探索。