NeFut Logo NeFut
EN 管理员登录

[AI学术] RRS-10K:稀有遥感图像解读的多任务视觉语言模型基准

发布于:2026-07-29 22:00 最后更新:2026-07-30 03:24
#AI #Machine Learning #Open Source

摘要

视觉语言模型(VLMs)在一般遥感任务上表现出色,但对稀有场景的能力仍未得到充分理解,因为现有基准主要集中在常见的城市和乡村图像上。为了解决这一问题,我们提出了 RRS-10K,这是一个用于稀有遥感图像解读的基准。

RRS-10K 包含 10,738 张与军事相关的遥感图像及相应的多种格式问答对,以便进行全面评估。所有图像均来源于第一手资料,并分为三个能力维度、六个子维度和 20 个叶任务,涵盖感知、推理和鲁棒性。

为了提高多项选择题的质量,我们在基准构建中引入了一种基于相似度的干扰项过滤策略(SDFS)。我们进一步评估了 52 个代表性模型,结果表明,当前的 VLMs 在稀有遥感图像解读上的 zero-shot 性能仅为中等,尤其在视觉定位、引用分割和复杂语义推理任务上存在明显弱点。

RRS-10K 使得对长尾遥感图像解读中的失败模式进行系统分析成为可能,并为开发更可靠的遥感 VLMs 提供了指导。

博主点评: RRS-10K 基准的提出填补了稀有遥感图像解读领域的空白,针对传统 VLMs 的局限性提供了深刻见解。通过引入 SDFS 策略,显著提升了问答质量,这一创新举措有助于推动遥感技术的发展。未来的研究可聚焦于如何进一步优化模型在稀有场景下的表现。

原文链接: https://arxiv.org/abs/2607.24810

[h] 返回首页