NeFut Logo NeFut
EN 管理员登录

[AI学术] DepthEvidence:统一度量深度预测与几何推理的多模态语言模型

发布于:2026-09-29 22:00 最后更新:2026-09-30 01:41
#AI #Machine Learning #Geometry

DepthEvidence 是一个参数量约 4B 的多模态语言模型,旨在将度量深度预测与几何推理统一到同一语言生成流程中。模型在解码阶段引入相机条件,使解码器能够基于多尺度视觉特征和高分辨率 RGB 细化,直接输出全分辨率的度量深度图。随后,dense‑to‑language 接口将预测的深度图和解码器特征映射为与对象标识对应的连续几何 token,这些 token 充当语言生成的客观证据。

几何监督被设计为在语言上下文交互前后都能恢复度量信息,确保数值内容在推理过程中不被丢失。通过指令微调,模型学习了对象测量、相对比较以及组合推理等任务。为评估模型的空间数值推理能力,作者构建了 Depth‑VQA 基准,涵盖对象深度查询、相对比较以及结合空间与数值约束的决策三类任务。

在跨越九个公开数据集的实验中,DepthEvidence 在平均稠密误差指标 $\delta_1$ 上取得最高分,且与专用深度估计器的表现相当。模型在实例级度量深度估计、相对推理和度量推理两个轨道上均领先于其他评估方法,同时几乎不牺牲原有 VQA 能力,甚至在空间理解方面相较基线模型有明显提升。

点评:DepthEvidence 展示了将视觉几何信息直接嵌入语言模型的可行性,尤其在保持数值精度的同时实现了灵活的语言推理,为多模态 AI 的空间认知打开了新路径。

原文链接: https://arxiv.org/abs/2609.31103

[h] 返回首页