在 Transformer 语言模型中,少数异常高增益的参数能够产生不成比例的影响。本文探讨了这种结构是否在基因组基础模型中同样出现,以及结构几何是否决定功能重要性。我们在文本和基因组基础模型中分析了门控前馈网络(gated‑FFN)的高增益行,使用了一个冻结的 22‑模型因果普查,并精确计算了关联的双线性权重算子,未采用对角近似。
实验表明,基于激活的候选行相较于随机和同层 top‑norm 控制具有显著的功能富集。然而,光谱集中度和算子幅值均未能预测因果效应大小,且在端点同质的文本解码器子集内,这些关联消失。
进一步在一个基因组解码器和一个文本解码器中对同层 36 行进行扫描,得到两种情形:当检测器接受阈值以下时,比例信息与因果损伤无正相关;阈值以上时,比例能够对行进行排序,但并未呈现剂量‑响应式的严重度梯度。该扫描还发现了第二条在单模型普查中不可见的致灾行,以及共址关键行之间的非加性损伤。
案例研究显示因果组织的差异:在 DNABERT‑2 中出现了稳健的超加性配对交互;在 GENERator 中则表现为高度位置局部化的依赖——只要保留或恢复该行在序列起始(BOS)处的贡献,即可几乎完全恢复原始性能。
因此,高增益门控‑FFN 行是一种可复现的架构表型,其结构显著性提供了富集信号,却不是功能关键性的校准度量,也不决定因果组织的具体形式。富集是普遍的,但机制是模型特定的。
点评:本文通过严谨的算子分析和层内扫描,揭示了高增益 FFN 行在不同模型中的共性与差异,为理解 Transformer 结构的功能重要性提供了新视角。未来工作可进一步探索如何利用这些结构信号进行模型解释或安全性评估。