在无人机(UAV)场景中,语言引导的航拍感知旨在理解用户指定的微小目标。由于无人机在飞行中需要实时响应,因此这种感知以在线流的方式运行,帧按顺序到达,模型对每一帧进行响应,而无法访问未来帧。然而,将现有的多模态大语言模型(MLLMs)应用于此场景面临两个挑战。首先,从空中观察的目标通常很小,但现有MLLMs中的视觉压缩对所有区域的处理相同,导致细微细节被丢弃。其次,理解连续流需要过去帧的上下文,但在资源受限的机载硬件上保留整个历史是不切实际的,而丢弃历史则可能导致目标漂移或消失。
我们从数据和方法两个角度解决了小目标和流媒体的挑战。从数据角度来看,我们提出了DroneEyes,这是第一个像素级和开放词汇的参考分割数据集,专为微小航拍目标设计,包含$2,140$个高清晰度视频和$176,623$对对象描述及参考表达任务,提供密集的每帧掩码。
从方法角度,我们提出了SkyAnchor,这是一个具有两项设计以应对上述挑战的MLLM:一个语义感知的令牌路由器,可以在减少视觉令牌预算的情况下保留小目标,和一个层次化记忆库,能够在流中保持对目标的一致理解。