NeFut Logo NeFut
EN 管理员登录

[AI学术] 在视觉空间中通过多步嵌入检索学习路由

发布于:2026-10-01 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

LLM 代理依赖检索工具获取外部知识,但视觉代理搜索受单步检索器限制。当前流程要求代理为每一步生成文本查询,当视觉线索难以描述或检索器未能在前几条结果中返回必要中间证据时,性能急剧下降。我们假设将跨整个嵌入空间的多步导航直接交给检索工具可以突破此瓶颈。为系统评估,我们提出 VHOP——一个灵活的数据生成框架和基准,包含五个核心难度层级,分别考察视觉匹配和搜索规划能力。基于 VHOP,我们构建 VHOP‑Router,一套端到端训练流水线,融合监督微调、在线模仿学习和强化学习,将普通嵌入模型转化为自回归多步检索器。VHOP‑Router 在视觉潜在空间直接操作,仅一次工具调用即可检索出关联的图像链,无需代理生成中间文本查询。实验表明,检索成功率从不足 5% 提升至 76.3%,任务成功率提升 52.7%,平均 token 长度从 1886 降至 728,下降 61%,而仅升级代理的提升仅为 3.7%。相较于每步检索前 50 条结果的强基线,VHOP‑Router 在保持更佳性能的同时,将上下文图像数量降低 $23\times$,累计 API 负载降低 $35\times$。模型在未见难度和真实测试集上仍表现稳健。总体而言,VHOP 与 VHOP‑Router 为视觉代理搜索提供了高效且不破坏原生 LLM 能力的解决方案。

点评:该工作通过在视觉潜在空间直接进行多步检索,显著提升了检索效率和任务成功率,为视觉代理搜索指明了新方向。

原文链接: https://arxiv.org/abs/2609.38743

[h] 返回首页