在这篇论文中,我们探讨了 Transformer 前馈块架构设计的每个组成部分如何影响初始化时秩的保留程度。
我们重新解读了跳跃连接和归一化,认为它们不仅控制幅度,也作为在深度中保留梯度秩的机制。因为使网络具有表达能力的矩阵乘法和非线性激活也会降低秩。
我们表明,跳跃连接在秩崩溃与类似集成的行为之间进行权衡,这种权衡由分支与跳跃的相对规模控制:跳跃连接将梯度引导绕过残差分支,避免秩损失,而不是沿着鼓励层次组合的长梯度路径。
归一化层的放置同样控制这一权衡,通过在深度上设定分支与跳跃的比例,统一了大量关于归一化放置和深度缩放的文献,特别是为什么 Post-Norm 的秩会崩溃而 Pre-Norm 的秩会趋于平稳。
架构的其他方面,如扩展和收缩宽度的双矩阵结构,使用额外参数来保留表示或分支雅可比秩。第二个矩阵去相关了在单一矩阵和未中心化激活下,跨块增长的同一均值尖峰,防止残差表示崩溃。
两个矩阵之间的宽度扩展保持了分支雅可比的满秩:在这个扩展空间中应用降低秩的激活,留出足够的方向来覆盖原始空间,宽度遵循 Marchenko–Pastur 法则。
输入-输出雅可比的初始化秩可以预测哪些网络能够在 CIFAR-10 上训练。
综上所述,我们将深度网络的架构设计重新审视为在秩崩溃、类似集成行为和参数计数之间进行内在权衡的过程。
博主点评: 本文深入探讨了 Transformer 网络架构中秩的保持机制,强调了跳跃连接和归一化的作用。这一研究为理解深度学习模型的训练表现提供了新的视角,尤其是在如何优化网络设计方面,具有重要的理论和实践意义。理解这些机制有助于设计出更高效的深度学习模型,尤其是在处理复杂数据集时。