在预训练语言模型中替换注意力层会导致兼容性问题:新层可能改变后续层期望的表示。TinyCeNN-LM 提出一种质量门控的后训练转换框架,使用受 CeNN 启发的细胞递归层,实现有界局部处理、紧凑递归记忆、路由、融合以及接受或回滚验证。
框架研究了三种实现:Integrated Memory、MemoryFusion 和 PDelta3‑GDN2‑CLVR+Local32。严格的 PDelta3 转换仅在表示相似度和负对数似然($\Delta\mathrm{NLL}$)均满足固定阈值时接受层。
在 SmolLM2‑135M 上,层 0‑2 被接受,累计 $\Delta\mathrm{NLL}=+0.01209$,但层 3 虽然 NLL 可接受,却因表示保真度未达标被拒绝。
在 Qwen3.5‑0.8B 上,完整注意力层 3、7、11 均被接受,最终 $\Delta\mathrm{NLL}=+0.02073$。Integrated Memory 将困惑度波动控制在 $-0.07\%$ 到 $+0.93\%$ 之间,同时缓存总量最高降低 $6.01\%$。对 200 条下游样本的抽样检查显示,转换后的 Qwen 版本整体准确率在 $28.5\%$–$32.0\%$ 之间。
实验结果表明,保守的质量门控结构转换优于盲目替换注意力或单纯追求加速。
点评