现代神经网络的规模增长呈现可预测的规律,但背后的机制仍不清晰。传统上,网络冗余通过组件重要性或表征相似性来间接衡量,这两者都只能提供代理信息。我们将冗余视为一种输入条件化的动态关系:当中间计算状态在下游产生相似响应时,它们即被认为在功能上是冗余的。
为直接刻画这种功能替代关系,我们提出了条件功能可替代性(CFS)概念。CFS能够揭示传统重要性或相似性度量所遗漏的功能关联和可削减潜力。
在多模态任务和不同Transformer系列上实验表明,随着模型规模的扩大,CFS捕捉到系统性的功能重组。进一步的受控尺度实验显示,性能提升并不必然伴随可替代性的增长;相反,容量固定但功能结构更独立的模型表现更佳,这为“收益递减”现象提供了功能层面的解释。
利用CFS的预测结果,我们实现了基于功能可替代性的动态计算策略,其在性能‑计算权衡上优于基于重要性的组件选择方法。这提示了面向冗余感知的计算新方向以及更高效的模型扩展路径。
点评