NeFut Logo NeFut
EN 管理员登录

[AI学术] 突破性的量化小语言模型推理监控与动态重解码技术

发布于:2026-07-24 22:00 最后更新:2026-07-26 07:44
#algorithm #Machine Learning #optimization

摘要

量化的小自回归推理模型可能会进入长时间的重复或无效轨迹,而推理时的计算资源通常是在未观察到轨迹发展的情况下分配的。基于早期的基于token级的e-CUSUM控制器,我们开发了MGT-B(监控引导的测试时间回溯),这是一个修订的外部控制器,它将重叠窗口的预采样不确定性和退化特征映射到位置条件的经验尾概率,累积具有CUSUM形状重置的混合下注因子,并通过估计回滚点来响应警报,恢复token和key-value-cache状态,并执行受限重解码。

为了审计这种效应是否在手动选择的log阈值h = 10之后首次观察到的问题身份上持续存在,我们回顾性地排除了260个在阈值前的伪影中的ID,并保留每个剩余ID的时间上第一个后阈值对,形成一个240对的时间审计集。在这个集上,准确率从82/240提高到88/240(+2.50个百分点;13个修正,7个回归;精确的McNemar p = 0.2632;成对自助法95%区间[-1.25, +6.25])。更广泛的467对历史覆盖集的种子匹配对的准确率从146/467提高到167/467(+4.50点;McNemar p = 0.000753),但包括200个在阈值选择前或期间可用的seed-1 ID,仅作为探索性估计报告。467对集中316个无警报输出与标准输出完全相同,而151个警报轨迹包含29个修正和8个回归。两项分析均未被确认,经验因子未被确立为有效的e过程或e探测器。结果支持了对于研究的MATH-500设置的选择性监控与修复机制,而非一般性或理论上认证的推理改进。

博主点评: 本文提出的MGT-B方法通过监控推理过程中的不确定性与退化特征,为量化小语言模型提供了一种创新的动态调整机制。这种方法的有效性在实验中得到了初步验证,尽管仍需更多的确认性分析来确立其理论基础。

原文链接: https://arxiv.org/abs/2607.20129

[h] 返回首页