摘要
受人类交流空间信息的启发,基于语言的地理定位因其直观和实用的价值而受到广泛关注。尽管已有进展,但大多数方法仍然依赖静态的一次性检索范式,无法处理现实世界自然语言描述中的模糊性和不完整性。我们提出一种范式转变,称为对话地点识别(DlgPR),将定位视为一个互动的、由对话驱动的推理过程。
为支持这一新任务,我们推出了 DlgQuest-Cities,这是首个大规模基于对话的地点识别基准,并提出一个统一的推理框架,该框架结合了跨模态多级检索器与智能提问者 DQ-pilot。DQ-pilot 采用课程训练:在一个精心挑选的 DQ-cities-20k 子集上进行监督微调,然后在更难的 DQ-cities-10k 拆分上通过 GRPO 进行强化精炼。
学习过程中使用两个任务对齐的指标:一个用于课程采样的判别难度指数(DDI),以及一个直接测量由问题引起的检索改进的位置信息检索增益(PRG)奖励。实验结果表明,这种基于推理的方法显著优于基线。
代码和模型可在 GitHub 获取。
博主点评: 该研究通过引入对话机制,显著提升了地点识别的准确性与灵活性,展现了人机交互的新潜力,尤其是在处理复杂自然语言描述方面的优势,值得关注。