NeFut Logo NeFut
EN 管理员登录

[AI学术] 评估LLM路由的升级信号:目标、控制与自欺的五种方式

发布于:2026-10-07 22:00 最后更新:2026-10-08 01:25
#AI #Machine Learning #LLM

决定何时将查询从小模型升级到大模型需要一种廉价信号,能够在调用大模型之前预测升级是否有益。语义熵最初用于检测幻觉,它衡量模型采样答案在意义上的分歧程度,分歧高通常意味着答案不可靠。我们在三个基准和两类模型上测试了它。

在 GSM8K 上,使用大小相差约十二倍的小/大模型对,语义熵能够可靠地区分小模型的错误(AUROC 0.871),在相同成本下相较随机升级提升了最多九个百分点的路由准确率。早前在合成基准上得到的强结果被证明是误导性的:仅基于问题难度的简单规则(不涉及模型)几乎完全复制了语义熵的表现。本文的核心贡献是一套检查方法,帮助在报告前捕捉此类假象。

我们展示了以下要点:

  1. 将仅基于问题的难度估计与任何信号一起评分,可判断该信号是否提供了真实信息,还是仅跟随问题的表面难度。
  2. 两种合理的“升级成功”定义在同一数据上可能产生截然不同的结论。
  3. 某些基准几乎没有余地让任何信号超越始终使用大模型的策略。
  4. 实时采样的真实成本可能使路由比直接调用大模型更昂贵。
  5. 作为更廉价的替代方案,利用缓存的历史结果并预测其在新数据集上的有效性。我们成功预判了一次 AUROC 从 0.908 下降到随机水平 0.518 的崩溃。

基于上述观察,我们提供了一份通用检查清单,用于评估任何升级信号的可靠性。

点评

原文链接: https://arxiv.org/abs/2610.07354

[h] 返回首页