在硅光子(SiPh)加速器上,视觉变换器(ViT)推理通过在微环谐振器(MRR)阵列上执行矩阵乘法,实现了高吞吐量和能效。然而,将这些平台扩展至支持芯片上微调依然面临挑战,因为反向传播需要大量的激活存储、频繁的权重写回到MRR,并且需要对设备级噪声的容忍。
我们提出了Opto-ViT-v2,这是第一个在近传感器SiPh ViT加速器上进行参数高效微调(PEFT)的框架。我们的张量化低秩分解将预训练的光学权重与一小组可训练的电子因子分开(ViT-Base仅需8K参数),显著减少了激活存储和权重更新,同时实现了实际的芯片上训练。
我们进一步引入了一种梯度累积稀疏分类器,通过一次性top-k梯度掩蔽冻结低重要性权重,将分类器训练成本降低了约40%。我们还开发了第一个系统级噪声模型,用于光子芯片上训练,捕捉MRR串扰、热漂移和激光幅度噪声在前向和反向传播中的影响。
通过对超过200个制造的MRR设备的测量进行校准,该模型表明,在相同噪声条件下,低秩因子更新比完全微调和传统的逐层低秩适应更加稳健。在VTAB-1K(19个任务)和FGVC少样本基准测试中的实验表明,Opto-ViT-v2在测量的光子噪声下恢复了0.3%到0.8%的干净软件准确率,同时达到了超过100 KFPS/W,推动了光子边缘视觉系统的实际芯片上领域适应。