摘要
LEED v4.1 BD+C 认证依然是一个文档密集型的过程,审核员需要手动阅读数百页项目证据并应用特定的信用阈值逻辑。本文探讨了小型本地部署的语言模型是否能够对LEED文档进行有效筛查,以及确定性符号组件应如何分担这一工作。我们引入了一种神经符号管道,该管道将项目PDF与LEED信用部分对齐,使用信用感知的关键词签名检索证据,通过本地托管的一个40亿参数的语言模型验证合规性,并应用一个特定于LEED的数值检查器来处理定量阈值。
在对四座大学建筑(484个PDF,153个信用级决策)的实验中,发现40亿参数模型(gemma3:4b)在文本核心验证器中表现最佳,准确率达到67.3%,超越了更大规模的80亿参数模型(llama3.1:8b)。确定性数值检查器在关键定量信用上纠正了算术错误,使EA-p2的准确率从50%提升至100%,并在可靠提取所需值时改善了其他几个信用。同时,完整的神经符号配置整体准确率为61.6%,由于提取失败和对定性类别的保守行为,未能超越最佳文本基线。系统的消融实验表明,添加低分辨率绘图图像(150-300 dpi)始终会降低准确率,而提示词的有效性依赖于建筑的真实PASS率:在文档丰富的项目中,评分标准提示效果最佳,而在文档稀缺的项目中,思维链提示效果更佳。在LEED v4.1 BD+C合规验证的特定范围内,该管道及其基线为准确性和失败模式提供了初步可重复的参考点。
博主点评: 这项研究展示了神经符号AI在复杂文档处理中的潜力,尤其是在LEED合规审核这样的领域。通过结合语言模型与确定性检查器,研究不仅提升了合规性验证的准确性,同时也为未来的文档驱动AI应用提供了重要参考。该方法的局限性在于对低质量图像的敏感性,未来的改进可集中在图像处理技术上,以进一步提升整体性能。