视觉语言模型(VLM)在多模态检索中能够对候选列表进行高质量的重排序,但其推理成本高,使得只能在少量局部候选视图上评估。\ \ 传统的多调用策略采用固定的调度计划,往往在信息量不足的候选对或易检索的查询上浪费昂贵的 VLM 调用。\ \ 为此我们提出 自适应多视角预算化 Elo 重排序(AMBER),它是一个在线、预算受限的多视角重排序框架,能够动态优化全局资源分配。AMBER 将碎片化的列表式 VLM 输出视为局部锦标赛,利用连续的 Elo 更新保持轻量的全局排名状态。\ \ 在此基础上,AMBER 在两个层面分配计算:一是动态构造得分模糊度高的候选视图,二是调度查询以最大化期望信息增益。我们证明每一次 Elo 更新等价于对 Bradley‑Terry 对数似然的随机梯度上升步,并给出查询层分配策略的子模信息论动机。\ \ 在 CIRR、CIRCO 和 PhotoBench 三个基准上实验表明,AMBER 在相同 VLM 调用预算下相较于其他多调用重排序方法取得最强整体性能,并在低预算场景下仍保持有效。\ \ 代码已公开:https://github.com/wnlfc/AMBER\ \ 点评:AMBER 通过将 Elo 赛制与信息论子模性结合,实现了对 VLM 计算资源的细粒度、动态调度,为高效多模态检索提供了可复制的思路。