摘要
功能保持的网络增长技术(如 Net2Net 和渐进堆叠)可以扩展模型的容量,而不破坏其学习功能。然而,现有的公式要么容忍数值扰动,要么要求完全重建训练程序。我们正式定义精准网络手术:在一个活跃的计算图中就地插入一个残差块,以确保(i)网络功能得到保持——在明确的浮点假设下逐位精确,以及(ii)插入的参数在插入后立即可训练。
我们证明了一个针对门控残差块的同构定理,一个结构局部性定理,表明反应无效化引擎准确地重新计算插入点的下游锥体,保持其他节点的值和优化器状态不变,以及一个逃离初始化的命题,显示在随机初始化的分支上,零初始化的梯度阴影门 alpha 在插入时获得一个通用的非零梯度。
我们识别出一个退化配置——零初始化输出投影结合零门——这是一个精确的鞍点,梯度下降无法逃脱。每个声明都在 NeuroDSL 的参考实现上得到了验证,这是一种在 Julia 中实现的反应图引擎:在测试的每个 logit 上 grafting 都是逐位精确的(1600 次测试中没有不匹配);门在第一个优化步骤中逃离零,并在第二步解锁分支梯度,正如预测的那样;退化配置在整个 600 步运行中展现出完全为零的梯度;手术成本与下游锥体大小的相关性为 r = 0.9992,而 graft-plus-invalidation 的记账在插入深度上是常数(约 0.75 毫秒);训练在实际进程重启中逐位相同地恢复。一份标记的初步附录报告了插入后门动态的首次单种子观察。
博主点评: 这项研究在网络结构动态调整方面做出了重要贡献,尤其是在不干扰已有功能的情况下有效地扩展模型能力。精准网络手术的实现为未来的深度学习模型提供了新的灵活性和可扩展性,也为实时模型调整奠定了基础。通过验证和高精度的实验结果,研究者们清晰地展示了理论与实践的结合,值得关注。