在计算机辅助设计(CAD)平面图中,图形原件和文本注释共同提供了几何和语义线索,促进智能设计理解。随着工业数字化和基于深度学习的自动化需求的增长,全景符号识别变得尤为重要。然而,大多数现有方法仍主要以原件为中心,未能充分利用文本注释的语义价值。即便是少数关注文本的方案,通常也仅表面处理注释,而未能正确建模CAD注释的复杂语法和层次语义,这导致了语义损失和次优的识别性能。
为了解决这些局限性,我们提出了TextCAD,一个多模态框架,联合建模图形原件和文本注释以进行全景符号识别。具体而言,我们设计了一种类型-属性关联编码器(TACE),通过联合建模注释的类型和属性,显式编码注释中的组合语义。我们进一步引入了一种语义层次对齐框架,结合多级语义过滤(MSF)和原件下采样,能够自适应地在不同语义层次上对齐注释语义与图形原件,从而实现准确的跨模态语义注入和融合。实验结果表明,TextCAD有效提高了符号识别性能,并取得了最先进的结果。
博主点评: 该研究通过将图形和文本信息相结合,显著提升了CAD平面图的符号识别能力,展示了多模态学习的潜力和应用前景。