在深度神经网络(DNN)推理中,比特串行加速器利用比特级稀疏性以降低推理成本,但现有设计仅对单个操作数的稀疏性进行利用,限制了加速效果。
通过同时对两个操作数的稀疏性进行利用,可以显著减少部分乘积的计算,但这也引入了一个新的关键瓶颈:工作负载不平衡。由于每个并发的权重-激活对的执行成本取决于两个独立变化的操作数非零比特计数的乘积,因此必须同时完成的对的计算时间差异巨大,导致较快的计算处于空闲状态。这限制了现有双侧设计的处理单元(PE)利用率为56%至64%。
我们提出了BRIM,这是一种硬件-软件协同设计的双侧比特串行稀疏加速器,直接针对这一瓶颈。BRIM结合了两种集成机制:
- 循环平衡修剪(CBP):这是一种后训练权重优化方法,基于已分析的激活统计信息重塑权重表示,以在离线状态下平衡并发处理对的预期工作负载;
- 成对插槽捐赠:这是一种轻量级硬件机制,能够在计算过程中吸收残余的运行时不平衡,且几乎不增加面积开销。
在对卷积神经网络(CNN)、视觉变换器(ViTs)和大语言模型(LLMs)进行评估时,BRIM在等面积约束下实现了超过90%的PE利用率,最高可达2.37倍的速度提升,以及1.63倍的能效改进,相较于以往的双侧设计。