NeFut Logo NeFut
EN 管理员登录

[AI学术] 不确定性驱动的事件触发 LLM 调用决策规则

发布于:2026-07-16 22:00 最后更新:2026-07-17 08:45
#AI #Machine Learning #optimization

摘要

流媒体推理管道越来越多地将轻量级快速模型与大型语言模型(LLMs)结合,后者提供丰富的语义理解,但成本相当高。关于何时调用 LLM 的核心问题尚未得到充分的正式处理。我们将此视为一个基于风险的顺序停止问题,当观察历史上的风险函数超过阈值时,触发策略生效。

在此框架内,我们证明了六个结果:

  1. 最小事件间隔时间界限,排除触发抖动;
  2. 通过平滑粘贴证明阈值策略的最优性;
  3. 在估计参数下的近似 SPRT 保证;
  4. 对于平稳流,遗憾为 $O(\sqrt{T \log T})$,在 $C_T$ 变更点下扩展为 $O(\sqrt{(C_T + 1) T \log T})$;
  5. 自适应阈值的在线梯度下降收敛为 $O(\frac{1}{\sqrt{T}})$;
  6. 校准与漏报率的转移不等式。

多个经典触发家族,包括事件触发、最优停止、SPRT、CUSUM 和贝叶斯触发,都可以作为此框架的特例。在使用真实 LLM 调用的涡扇发动机退化数据(CMAPSS)上,我们实证验证了理论假设,剖析风险函数设计,比较了六个基线模型,包括 RouteLLM 风格的路由器和上下文带宽,并分析了成本敏感性和 LLM 失败模式。结果确认了亚线性遗憾,在我们的框架下 $\alpha = 0.75$;并且异常分数驱动的风险函数在帕累托 AUC 上比其他替代方案优越了大约一个数量级。

博主点评: 本文通过构建风险函数与事件触发机制的结合,提出了一种全新的 LLM 调用决策框架,极大地提升了流媒体推理的效率和经济性。

原文链接: https://arxiv.org/abs/2607.13048

[h] 返回首页