摘要
本研究探讨了视觉-语言模型(VLMs)在推断建筑类型(如建筑结构、当前用途和楼层数)方面的潜力,使用的数据来自谷歌街景图像(GSV)。我们将VLM生成的预测与人类专家(如土木工程师和建筑师)的推断进行比较,以获得手动标注的真实数据。研究评估了多种最先进的VLM,包括GPT-4o、Claude 3.5 Sonnet和Gemini 2.0 Flash。
通过应用不同的扩展策略和提示技术,我们发现“思维链”提示能够提供更稳定的模型性能。我们还通过分析AI解释中关键词出现的概率,研究了VLM在建筑类型预测中的推理过程。这使我们能够分析这些推理中的模式,并识别推动VLM与专家标签一致与不一致的关键主题。
研究发现,AI倾向于关注视觉指标,而人类专家则更注重更广泛的上下文线索和领域知识,除了视觉线索外。总体而言,VLM在建筑类型分类上能够在规模上接近专家的能力,平均准确率约为70%。本研究展示了VLM在需要模式识别和物体识别的城市情境中的AI自动化潜力。AI有可能作为城市分析的补充和协作工具,利用其在理解视觉模式方面的优势。本研究为AI视觉预测的效率和可扩展性探索提供了贡献,并为支持城市分析和预测中的自动化过程提供了推理过程的见解。
博主点评: 本研究不仅展示了AI在建筑类型识别中的实际应用潜力,同时也揭示了AI与人类专家之间在推理过程中的根本差异。这为未来的城市分析工具提供了重要的启示,强调了AI与人类合作的可能性。通过更深入地理解这些差异,未来的研究可以进一步提升AI模型的准确性和实用性。