NeFut Logo NeFut
EN 管理员登录

[AI学术] 灾难地名消歧义:融合多模态LLM与跨视角地理定位的创新框架

发布于:2026-07-30 22:00 最后更新:2026-07-30 23:39
#AI #Machine Learning #optimization

摘要

社交媒体图像(SMI)提供了及时且细致的地面视角,对情境意识和应急响应至关重要。与卫星或航空图像不同,SMI能够及时捕捉灾难影响和地面条件。然而,SMI中的地理参考常常模糊或歧义,使得准确的地理定位变得具有挑战性。为了解决这一问题,我们提出了DisasterTD,一个灾难地名消歧义框架,结合了基于多模态大语言模型(MLLMs)的语义推理与跨视角地理定位。

首先,MLLMs从嘈杂的文本输入中提取地名并生成候选地理位置。然后,通过对SMI、遥感图像(RSI)以及可选的街景图像(SVI)之间进行跨视角匹配,来验证和优化这些候选结果。我们在哈维飓风数据集上评估DisasterTD,该数据集通过收集的RSI和SVI增强了SMI,构建了灾难地理定位的跨视角基准。该数据集根据地名的清晰度和歧义性分为四个类别,允许对不同场景进行细致的性能分析。

结果表明,DisasterTD在没有消歧的情况下,始终优于仅使用MLLM和仅使用跨视角基准的模型,达到1000米内71.62%、500米内62.36%、250米内57.99%、100米内52.09%和50米内47.01%的地理定位准确率,同时将均值和中位数误差降低到11.33公里和0.68公里。最大的改进出现在模糊地名中,语义推理与跨视角证据结合有效减少了候选的离散度和误差。这些发现展示了将基于MLLM的候选生成与跨视角验证结合用于细粒度灾难地理定位的有效性。

博主点评: DisasterTD通过整合多模态大语言模型与跨视角验证,显著提高了灾难地名的消歧义能力,为应急响应提供了更为精准的地理定位手段,展现了现代技术在危机管理中的巨大潜力。

原文链接: https://arxiv.org/abs/2607.24856

[h] 返回首页