随着人工智能模型在理解和处理空间信息方面的进步,空间任务和工作流程中的代理问题解决能力也在不断提高。然而,大多数关于空间能力的研究(例如空间推理)都集中在文本模态作为输入和输出。这与人类处理 GIS 工作流程的方式不同,人类通常同时使用文本和视觉模态,交替使用,互相补充。因此,要真正实现自动化 GIS 分析管道或执行人类设计的 GIS 工作流程,人工智能模型(特别是大型多模态模型(LMM))需要能够无缝地在图像和文本模态之间转换,这两种模态在传统工作流程中经常被使用。我们提出了一种模态转换任务:(1)要求 LMM 首先描述输入图像中的彩色正方形网格,并(2)要求新的 LMM 实例根据前一个模型输出的文本描述重新生成原始空间场景的图像。这个任务量化了 LMM 在图像和文本模态之间转换空间信息的能力。最终,通过空间信息理论的视角来检查 LMM 的模态转换能力,这项工作强调了一个关键的瓶颈:在 LMM 中实现强大、鲁棒的空间理解需要严格的多模态对齐。我们的结果表明,最近的 LMM(来自 OpenAI)在重新生成简单空间网格的彩色正方形图像时仍然难以进行模态转换。 博主点评: 本文强调了 LMM 模态转换能力的重要性,尤其是在 GIS 工作流程中,这对于实现自动化和高效的空间信息处理至关重要。未来研究应重点关注改进 LMM 的模态转换能力,以实现更强大的空间理解和应用。