多模型语言服务需要在计算、延迟、内存或成本等工作负载层面的预算约束下为每个请求选择路由。两大因素使问题比静态模型选择更为复杂:提示的表示是高维的,仅少数嵌入方向能够预测模型的增量价值;而请求组合和模型前沿会在新模型发布、微调、量化或系统更新后产生漂移。
我们将此问题形式化为带有多背包约束的非平稳稀疏上下文路由,并可选加入影子审计流,对少量提示在多个模型上进行评估,以获得真实奖励信号。
基于此提出漂移感知稀疏路由(DRS)。策略从滚动审计窗口估计奖励和资源使用,使用悲观的奖励估计和乐观的成本估计进行路由,在线更新资源的影子价格,并在最终提交前施加硬性计量器以确保预算不被超出。
分析上将控制部分与统计部分分离。对任意统一预测半径 $\{\beta_t\}$,相对于有节奏的动态流体基准的后悔上界为半径之和、容量缓冲项以及 $O(\sqrt{T})$ 的节奏项之和。
在稀疏线性模型且漂移有界 $V_T$ 的情形下,滚动估计得到的上界为 $$\widetilde O\left( T\sqrt{\frac{s}{\rho W}}+WV_T+\sqrt{T} \right),$$ 其中 $s$ 为稀疏度,$\rho$ 为审计率,$W$ 为窗口长度。选择最优窗口长度 $W$ 可在 $V_T=0$ 时恢复常规的 $O(\sqrt{sT/\rho})$ 速率,而在存在漂移时产生 $O\big(T^{2/3}(s/\rho)^{1/3}V_T^{1/3}\big)$ 的适应项。
点评