NeFut Logo NeFut
EN 管理员登录

[AI学术] 对话驱动的视觉地点识别:开创人机交互新模式

发布于:2026-07-17 22:00 最后更新:2026-07-18 08:18
#AI #Machine Learning #Open Source

摘要

受人类交流空间信息的启发,基于语言的地理定位因其直观和实用的价值而受到广泛关注。尽管已有进展,但大多数方法仍然依赖静态的一次性检索范式,无法处理现实世界自然语言描述中的模糊性和不完整性。我们提出一种范式转变,称为对话地点识别(DlgPR),将定位视为一个互动的、由对话驱动的推理过程。

为支持这一新任务,我们推出了 DlgQuest-Cities,这是首个大规模基于对话的地点识别基准,并提出一个统一的推理框架,该框架结合了跨模态多级检索器与智能提问者 DQ-pilot。DQ-pilot 采用课程训练:在一个精心挑选的 DQ-cities-20k 子集上进行监督微调,然后在更难的 DQ-cities-10k 拆分上通过 GRPO 进行强化精炼。

学习过程中使用两个任务对齐的指标:一个用于课程采样的判别难度指数(DDI),以及一个直接测量由问题引起的检索改进的位置信息检索增益(PRG)奖励。实验结果表明,这种基于推理的方法显著优于基线。

代码和模型可在 GitHub 获取。

博主点评: 该研究通过引入对话机制,显著提升了地点识别的准确性与灵活性,展现了人机交互的新潜力,尤其是在处理复杂自然语言描述方面的优势,值得关注。

原文链接: https://arxiv.org/abs/2607.14115

[h] 返回首页