本文关注在大型语言模型(LLM)规划器旁边运行小语言模型(SLM)完成微任务的可行性。微任务包括自动批准 shell 命令、写入记忆、选择工具、对历史对话进行排序等。我们提出了一个基准,包含四个固定提示的微任务,每个任务设定了阈值 $\tau$,该阈值相对于一个廉价的非 LLM 基线,并采用置信区间(CI)驱动的合格规则:只有当配置的置信上界超过 $\tau$ 时才视为合格。
在最佳设置下(FP16、贪婪解码、单一冻结提示、无微调),我们对 Qwen3 系列的 0.6B、1.7B、4B、8B 四个模型进行全面扫描。结果显示 16 种配置(4 项任务 × 4 种模型)全部不合格。我们进一步使用对数概率决策阈值诊断(针对任务 T1、T3、T4)以及上下文长度/级联探针(针对任务 T2)将失败划分为能力不足和可通过调节解码阈值解决的两类,共四种情形。
将模型量化到 4 位(RTN、GPTQ、AWQ)后,性能受损程度随模型规模而异,但仍未出现合格配置。该现象在 Llama‑3.x 系列上同样复现(全部 12 种配置不合格),并对阈值 $\tau$ 的不同取值以及提示的中性改写保持鲁棒——在原始提示及三种改写的每个单元格中均为 0/112 合格。
实践意义在于:应将 SLM 放在能够满足 CI‑backed 阈值的基线之后,仅在基线未达标时使用 SLM。例如,使用 4B 重排序模型对 BM25 生成的候选列表进行二次排序,可提升 BM25 $+0.047$(置信区间 $[0.020, 0.073]$),但自身仍未通过合格认证。
点评