NeFut Logo NeFut
EN 管理员登录

[AI学术] 颠覆性解码监控:重新审视量化推理模型的中心化令牌对数概率

发布于:2026-07-15 22:00 最后更新:2026-07-17 08:46
#AI #Machine Learning #optimization

摘要

低比特量化使得小型推理模型的部署成本降低,但可能会削弱其思维链。这促使我们在解码器端引入监控机制,以便在生成过程变得不可靠时进行干预。我们展示了一个自然候选者,即中心化令牌对数概率增量 $\log p(w_t) + H_t$,在此目的下是错误的观察量。根据模型自身的采样法则,它构成了一个均值为零的马尔可夫过程,因此它测量的是采样自一致性而非轨迹健康,在自信重复时几乎无声,其中 $\log p(w_t)$ 和熵接近零。

我们引入了一种无训练的解码控制器,结合了(i) 衰退感知警报评分,融合令牌不确定性与明确的逐字重复,以及(ii) 基于校准的 e-process 启发的序列检测器。原始乘积过程在条件均值零假设下是 Ville-valid,而部署的 CUSUM-floored 统计量被视为经验变化检测器,因为该评分依赖于历史且具有自相关性。在使用 DeepSeek-R1-Distill-Qwen-1.5B 的 GSM8K 数据集上,校准使得一个在 93--95% 生成中触发的监控器转变为对失败轨迹的选择性检测器($\phi \approx 0.3$,精度 $\approx 0.6$,基率为 0.38)。在这一试点中,控制器减少了测量的逐字衰退信号,并在 INT4 精度上产生了从 63% 到 69% 的积极但统计上不显著的变化(配对 McNemar $p=0.18$,$n=100$),代价为 28% 的令牌预算。我们还发现,在 GSM8K 上,非终止而非循环是占主导地位的失败模式。主要贡献在于方法论:解释了为何中心化令牌对数概率对解码监控不够充分,以及一个经过校准的、谨慎评估的替代方案。

博主点评: 该研究揭示了低比特量化模型在推理过程中的潜在问题,尤其是监控机制的有效性。通过引入新的解码控制器,研究者们不仅提供了更准确的监控工具,还推动了对量化推理模型理解的深入,值得关注!

原文链接: https://arxiv.org/abs/2607.11317

[h] 返回首页