在标准的 Transformer 架构中,语义重要性常常与激活幅度混淆,这掩盖了潜在表示的几何结构。为了解开这些因素的纠缠,我们引入了 PRISM,一种旨在隔离相位计算角色的复数值架构。
通过强制单位范数约束($|z| = 1$)并用门控谐波卷积替代注意力机制,该模型被鼓励在频域中利用减法干扰来抑制噪声,而不是依赖于基于幅度的门控。
我们利用这一受限机制研究了一种混合架构——将基于相位的路由与标准注意力相结合——在我们评估的设置中,相较于基线模型,达到了更好的参数效率和表示质量。
从机制上看,干预性切除实验表明,该模型在相位中携带了大量与任务相关的信息:保留相位基本维持了性能,而破坏相位则导致严重降级。
综合来看,这些结果表明,基于相位的频谱干扰是用于神经序列建模的一种可用计算机制。
博主点评: PRISM 模型通过引入相位的概念,挑战了传统的基于幅度的神经网络设计。这一方法不仅提高了参数效率,还揭示了相位在信息传递中的重要性,未来可能为更高效的模型设计提供新的思路。此研究为深度学习领域带来了新的视角,值得深入探讨。