卷积神经网络通常包含冗余的特征图,这会增加存储和推理成本。本文提出了一种基于多臂老虎机的损失感知特征图剪枝框架。特征图剪枝是结构化的,因为它移除完整的卷积输出通道及其生成的滤波器,而不是孤立的标量权重。
在这个框架中,每个候选特征图被视为一个“臂”。在每次尝试中,暂时屏蔽一个特征图并在采样的小批量上进行评估;然后恢复该特征图,观察到的损失变化被转换为安全移除奖励。在固定的尝试预算后,候选图通过学习的得分进行排名,前k个特征图及其滤波器、偏置和相应的下一层输入通道内核被永久移除。
研究评估了UCB1和汤普森采样,将其与在LeNet/MNIST上的直接/Oracle风格评估进行比较,并扩展到MNIST、CIFAR-10、CIFAR-100、SVHN、CUB-200-2011和Oxford Flowers 102。结果表明,UCB1和汤普森采样在移除特征图和减少卷积计算的同时,保持了接近未剪枝模型的准确性。Friedman和Nemenyi测试显示,UCB1获得了最高的平均排名,其次是汤普森采样;两者在统计上显著优于贪婪和基于幅度的剪枝,同时与原始未剪枝模型保持统计可比性。
博主点评: 本文通过多臂老虎机方法探索了特征图剪枝的新方法,展现了在保持模型性能的前提下有效减少计算资源的潜力。这种损失感知的方法为未来的网络优化提供了新的思路,值得在更广泛的应用中进行深入研究。