决定何时将查询从小模型升级到大模型需要一种廉价信号,能够在调用大模型之前预测升级是否有益。语义熵最初用于检测幻觉,它衡量模型采样答案在意义上的分歧程度,分歧高通常意味着答案不可靠。我们在三个基准和两类模型上测试了它。
在 GSM8K 上,使用大小相差约十二倍的小/大模型对,语义熵能够可靠地区分小模型的错误(AUROC 0.871),在相同成本下相较随机升级提升了最多九个百分点的路由准确率。早前在合成基准上得到的强结果被证明是误导性的:仅基于问题难度的简单规则(不涉及模型)几乎完全复制了语义熵的表现。本文的核心贡献是一套检查方法,帮助在报告前捕捉此类假象。
我们展示了以下要点:
- 将仅基于问题的难度估计与任何信号一起评分,可判断该信号是否提供了真实信息,还是仅跟随问题的表面难度。
- 两种合理的“升级成功”定义在同一数据上可能产生截然不同的结论。
- 某些基准几乎没有余地让任何信号超越始终使用大模型的策略。
- 实时采样的真实成本可能使路由比直接调用大模型更昂贵。
- 作为更廉价的替代方案,利用缓存的历史结果并预测其在新数据集上的有效性。我们成功预判了一次 AUROC 从 0.908 下降到随机水平 0.518 的崩溃。
基于上述观察,我们提供了一份通用检查清单,用于评估任何升级信号的可靠性。
点评