我们推出了DrawingVQA,这是首个旨在评估多模态大型语言模型(MLLMs)在真实建筑图纸上的基准。这些图纸是建筑、土木及许多其他工程实践中的核心媒介。
不同于自然图像或示意性平面图,建筑图纸融合了抽象几何、符号标记、表格数据、注释及领域特定文本,形成了一个独特复杂的视觉-文本领域,这对于工程工作流程至关重要。
DrawingVQA通过33幅“施工用图”和92对专家精心策划的问题-答案对,填补了这一空白,涵盖了三个推理深度:感知理解、上下文解释和领域专家推理。
为了评估模型能力,我们提出了一个双重分类框架,联合分析七个建筑工程和四个MLLM能力维度的性能,这是首次明确映射工程工作流程与AI推理能力。
对最先进的MLLMs的评估揭示了模型与专家性能之间的显著差距,尤其是在更高的推理深度上。
该基准为领域专业化的多模态推理奠定了基础,以促进AI驱动理解与真实工程工作流程的整合进步。
博主点评: DrawingVQA的推出标志着多模态语言模型在工程领域的重要进展,尤其是针对复杂的建筑图纸的处理能力。该基准不仅填补了现有研究的空白,还为未来在实际工程应用中的AI集成提供了可行的评估和改进方向。