NeFut Logo NeFut
EN 管理员登录

[AI学术] DrawingVQA:建筑图纸多层次视觉-文本推理的实用基准

发布于:2026-07-20 22:00 最后更新:2026-07-22 01:02
#AI #Machine Learning #Open Source

我们推出了DrawingVQA,这是首个旨在评估多模态大型语言模型(MLLMs)在真实建筑图纸上的基准。这些图纸是建筑、土木及许多其他工程实践中的核心媒介。

不同于自然图像或示意性平面图,建筑图纸融合了抽象几何、符号标记、表格数据、注释及领域特定文本,形成了一个独特复杂的视觉-文本领域,这对于工程工作流程至关重要。

DrawingVQA通过33幅“施工用图”和92对专家精心策划的问题-答案对,填补了这一空白,涵盖了三个推理深度:感知理解、上下文解释和领域专家推理。

为了评估模型能力,我们提出了一个双重分类框架,联合分析七个建筑工程和四个MLLM能力维度的性能,这是首次明确映射工程工作流程与AI推理能力。

对最先进的MLLMs的评估揭示了模型与专家性能之间的显著差距,尤其是在更高的推理深度上。

该基准为领域专业化的多模态推理奠定了基础,以促进AI驱动理解与真实工程工作流程的整合进步。

博主点评: DrawingVQA的推出标志着多模态语言模型在工程领域的重要进展,尤其是针对复杂的建筑图纸的处理能力。该基准不仅填补了现有研究的空白,还为未来在实际工程应用中的AI集成提供了可行的评估和改进方向。

原文链接: https://arxiv.org/abs/2607.15418

[h] 返回首页