视觉定位传统上被视为一次性将完整的指称表达映射到视觉目标的任务。然而,在真实场景中,目标信息往往不完整、模糊,需要通过交互来补全。为此,本文构建了一个受控评估框架,专门测评大规模视觉语言模型(LVLM)在交互式视觉定位中的表现。框架通过两类变量来调节难度:一是提前提供的目标信息量,二是需要通过对话获取的信息量。实验覆盖四种基于人工标注的视觉上下文和四种交互协议。
在所有设置下,当前的 LVLM 与任务层面的人工基准相比仍有显著差距。交互能够在后续提问对初始描述进行细化或修正时提升性能,但当完全没有初始描述、只能通过提问获取目标信息时,模型表现最差,说明主动式、问题驱动的定位仍然困难。模型还表现出校准不足的现象:报告的置信度常常高于实际准确率。
后续研究进一步验证了上述趋势在不同描述来源(人工 vs. AI)、推理深度、重复交互、描述提供者以及视觉上下文等维度上的一致性。总体来看,交互式视觉定位仍是一个重要挑战,需要模型具备视觉匹配、信息检索与综合推理的综合能力。
博主点评:本文通过系统化的交互评估揭示了 LVLM 在真实场景下的局限,为后续研究指明了提升信息获取与自我校准能力的方向。