结构化后训练剪枝需要挑选完整的功能单元,使其抑制对模型性能的影响有限。我们将语言和视觉 Transformer 的结构单元选择建模为在固定候选评估预算下的损伤感知多臂赌博机问题。
在校准批次上临时屏蔽注意力头和 MLP 通道组, 配对损伤定义为屏蔽后损失减去同批次的基准损失,以降低批次间的波动。
基于平滑有界奖励,我们采用 UCB 风格策略或分数 Beta Thompson 采样,并通过每一步加入一个单元的方式顺序构建最终掩码。选中的单元在原始稠密检查点中被功能性置零,因此报告的参数影响代表结构性抑制,而非实际压缩或测得的加速。
实验覆盖 WikiText-2、LAMBADA、Imagenette,模型包括 GPT-2、OPT、Pythia、Qwen2.5、SmolLM2、ViT‑B/16、DeiT‑Tiny、Swin‑Tiny,并与随机、幅度、静态显著性、预算贪婪等基线进行比较。五个随机种子下,带式臂方法在配对语言模型比较中通常比预算贪婪降低退化。论文中突出 28 组比较,23 条 bootstrap 置信区间不包含零,11 项配对检验的 p 值显著。
点评