NeFut Logo NeFut
EN 管理员登录

[AI学术] TinyCeNN-LM:基于 CeNN 的质量门控注意力转换框架

发布于:2026-09-21 22:00 最后更新:2026-09-22 02:29
#AI #LLM #Neural

在预训练语言模型中替换注意力层会导致兼容性问题:新层可能改变后续层期望的表示。TinyCeNN-LM 提出一种质量门控的后训练转换框架,使用受 CeNN 启发的细胞递归层,实现有界局部处理、紧凑递归记忆、路由、融合以及接受或回滚验证。

框架研究了三种实现:Integrated Memory、MemoryFusion 和 PDelta3‑GDN2‑CLVR+Local32。严格的 PDelta3 转换仅在表示相似度和负对数似然($\Delta\mathrm{NLL}$)均满足固定阈值时接受层。

在 SmolLM2‑135M 上,层 0‑2 被接受,累计 $\Delta\mathrm{NLL}=+0.01209$,但层 3 虽然 NLL 可接受,却因表示保真度未达标被拒绝。

在 Qwen3.5‑0.8B 上,完整注意力层 3、7、11 均被接受,最终 $\Delta\mathrm{NLL}=+0.02073$。Integrated Memory 将困惑度波动控制在 $-0.07\%$ 到 $+0.93\%$ 之间,同时缓存总量最高降低 $6.01\%$。对 200 条下游样本的抽样检查显示,转换后的 Qwen 版本整体准确率在 $28.5\%$–$32.0\%$ 之间。

实验结果表明,保守的质量门控结构转换优于盲目替换注意力或单纯追求加速。

点评

原文链接: https://arxiv.org/abs/2609.21139

[h] 返回首页