NeFut Logo NeFut
EN 管理员登录

[AI学术] 测量微任务合格差距:何时现成小模型足以支撑代理?

发布于:2026-10-02 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

本文关注在大型语言模型(LLM)规划器旁边运行小语言模型(SLM)完成微任务的可行性。微任务包括自动批准 shell 命令、写入记忆、选择工具、对历史对话进行排序等。我们提出了一个基准,包含四个固定提示的微任务,每个任务设定了阈值 $\tau$,该阈值相对于一个廉价的非 LLM 基线,并采用置信区间(CI)驱动的合格规则:只有当配置的置信上界超过 $\tau$ 时才视为合格。

在最佳设置下(FP16、贪婪解码、单一冻结提示、无微调),我们对 Qwen3 系列的 0.6B、1.7B、4B、8B 四个模型进行全面扫描。结果显示 16 种配置(4 项任务 × 4 种模型)全部不合格。我们进一步使用对数概率决策阈值诊断(针对任务 T1、T3、T4)以及上下文长度/级联探针(针对任务 T2)将失败划分为能力不足和可通过调节解码阈值解决的两类,共四种情形。

将模型量化到 4 位(RTN、GPTQ、AWQ)后,性能受损程度随模型规模而异,但仍未出现合格配置。该现象在 Llama‑3.x 系列上同样复现(全部 12 种配置不合格),并对阈值 $\tau$ 的不同取值以及提示的中性改写保持鲁棒——在原始提示及三种改写的每个单元格中均为 0/112 合格。

实践意义在于:应将 SLM 放在能够满足 CI‑backed 阈值的基线之后,仅在基线未达标时使用 SLM。例如,使用 4B 重排序模型对 BM25 生成的候选列表进行二次排序,可提升 BM25 $+0.047$(置信区间 $[0.020, 0.073]$),但自身仍未通过合格认证。

点评

原文链接: https://arxiv.org/abs/2610.00025

[h] 返回首页