在最近的FPGA设计中,深度学习推理效率得到了显著提升,主要得益于专用张量块和在BRAM中的计算。基于ReRAM的模拟内存计算(IMC)进一步推动了这一效率,提供了比传统数字逻辑高出一个数量级的计算密度和能效,能够在ReRAM交叉开关中直接执行向量-矩阵乘法(VMM)。
然而,传统IMC设计仅支持静态权重的VMM,导致非线性操作和动态矩阵-矩阵乘法(DIMM)仍需依赖FPGA架构。因此,IMC的优势主要限于静态权重模型,而基于Transformer的模型因频繁的非线性和DIMM操作而只能获得有限的提升。
此外,每个IMC块中的模数转换器(ADC)消耗了超过70%的面积和功耗,进一步限制了系统的效率和可扩展性。
为了解决这些限制,我们提出了一种新型FPGA架构,集成了无ADC的IMC块,用模拟内容寻址存储器(ACAMs)替代传统ADC,能够在块内部本地执行非线性操作。
为了充分利用该块,我们进行了FPGA感知的设计空间探索,确定了最佳交叉开关尺寸,同时平衡FPGA面积、灵活性和深度学习性能,并开发了一种高效的映射方法,利用ACAMs执行DIMM操作,从而将IMC的适用性扩展到注意力计算。
在卷积神经网络(CNN)和基于Transformer的基准测试中,所提出的架构在能效上分别提高了最高40倍和1.9倍,在面积效率上提高了4.1倍和2.5倍。
总体而言,该架构显著提升了FPGA在深度学习推理中的效率,并在长输入序列的Transformer工作负载上保持了强劲的性能提升,推动了领域专用FPGA设计的进步。
博主点评: 该研究展示了FPGA在机器学习推理领域的潜力,尤其是在Transformer模型处理中的应用。通过引入ACAMs,解决了传统ADC的瓶颈,极大地提升了能效和面积效率,标志着FPGA设计的新方向,值得进一步探索和应用。