摘要
视觉语言模型(VLMs)在一般遥感任务上表现出色,但对稀有场景的能力仍未得到充分理解,因为现有基准主要集中在常见的城市和乡村图像上。为了解决这一问题,我们提出了 RRS-10K,这是一个用于稀有遥感图像解读的基准。
RRS-10K 包含 10,738 张与军事相关的遥感图像及相应的多种格式问答对,以便进行全面评估。所有图像均来源于第一手资料,并分为三个能力维度、六个子维度和 20 个叶任务,涵盖感知、推理和鲁棒性。
为了提高多项选择题的质量,我们在基准构建中引入了一种基于相似度的干扰项过滤策略(SDFS)。我们进一步评估了 52 个代表性模型,结果表明,当前的 VLMs 在稀有遥感图像解读上的 zero-shot 性能仅为中等,尤其在视觉定位、引用分割和复杂语义推理任务上存在明显弱点。
RRS-10K 使得对长尾遥感图像解读中的失败模式进行系统分析成为可能,并为开发更可靠的遥感 VLMs 提供了指导。
博主点评: RRS-10K 基准的提出填补了稀有遥感图像解读领域的空白,针对传统 VLMs 的局限性提供了深刻见解。通过引入 SDFS 策略,显著提升了问答质量,这一创新举措有助于推动遥感技术的发展。未来的研究可聚焦于如何进一步优化模型在稀有场景下的表现。