随着基准测试和路由平台日益充当大语言模型(LLM)提供商与终端用户之间的中介,现有平台通常采用固定的每 token 价格,这限制了用户在不同任务上获得最具竞争力的报价。为了解决这一问题,我们设计了一种采购平台,使每个任务的 token 价格由提供商之间的竞争决定,从而让用户在保证质量的前提下获得更优的价格。
平台采用逆向二价拍卖(reverse second‑price auction)顺序路由查询,激励模型提供商如实报价其服务单个查询的平均成本估计。平台在路由过程中会学习每个提供商的质量表现,并逐步将查询分配给在满足期望质量阈值的前提下成本最具竞争力的提供商。
我们在 \texttt{Llama} 与 \texttt{Qwen} 系列模型上,对常用的数学推理和问答基准进行实验。实验结果显示,平台上最具成本竞争力的提供商的定价优势在不同任务和质量阈值下差异显著,范围从 $10\%$ 到 $71\%$ 不等。这表明当前固定价格市场存在显著低效,而我们的平台能够在竞争充分的市场环境中帮助用户实现最大化的成本节约。
点评:该工作通过逆向二价拍卖和质量学习机制,为 LLM 服务的成本优化提供了可行的市场化方案,展示了在保证可靠性的前提下实现显著费用削减的潜力。