在多模态大型语言模型(MLLMs)取得显著进展的背景下,从2D图像理解3D空间关系依然是一个关键挑战。现有方法主要依赖符号文本标记,这在本质上无法准确表示连续的几何信息。尽管近期方法开始使用潜在表征来增强推理能力,但依赖单一潜在类型无法适应多样化的空间任务,从而在复杂几何场景中造成对齐错误。
为了解决这些局限性,我们提出了GeoAnchor,这是一种交错的文本-潜在推理框架。GeoAnchor将3D空间信息分解为三个互补的组成部分:用于物体定位的位置潜在、用于关系方向的方向潜在,以及用于场景结构的几何潜在。这些组件在结构化空间中重新组合,以构建局部证据,同时捕捉全局上下文,从而实现动态和可解释的推理。
此外,我们还引入了一种协同训练策略,引导模型从局部空间感知到全面的3D理解。在多样化和复杂的3D推理任务上的广泛实验表明,GeoAnchor的性能超过了现有的最先进方法,验证了其有效性和泛化能力。
博主点评: GeoAnchor通过潜在分解的方法显著提升了3D空间理解的能力,展现了多模态推理的巨大潜力。其协同训练策略的创新性为未来的研究指明了方向,值得关注。