受从大量语言模型(LLM)集合中挑选最佳模型且查询成本不均的需求启发,我们将问题形式化为一种多臂赌博机(MAB)变体。该变体具备两大特性:
- 对抗反馈:通过模型响应的两两比较获得稳健的偏好信号;
- 异构采样成本:不同 LLM 的查询费用不同,需在选择时加以考虑。
在实验中我们观察到 Condorcet 胜者(即在所有两两比较中占优的模型)普遍存在,并以此为前提设计了基于 Track‑and‑Stop 思路的最佳臂识别算法,能够在给定置信度下停止采样。我们证明,当错误概率趋近于零时,该算法几乎必然达到渐近最优的总成本。随后在合成数据和真实数据集上进行大量实验,结果显示相较于传统的成本盲算法及其成本感知扩展,我们的方法在识别准确率和总查询费用上均有显著提升。
点评:该工作首次将对抗反馈与异构成本结合进最佳模型识别框架,提供了理论最优性保证并在实际场景中验证了有效性,为大规模 LLM 选型提供了实用工具。