NeFut Logo NeFut
EN 管理员登录

[AI学术] 深度与规模在150M以下模型中的探索:JugnuLM-53M 与 JugnuLM-110M

发布于:2026-09-16 22:00 最后更新:2026-09-18 00:46
#AI #Machine Learning #LLM

我们将常规的150M以下预训练配方从 53.5M 参数扩展到 109.7M 参数,保持方法不变(Qwen3 风格解码器,使用分组查询注意力、RoPE、SwiGLU、RMSNorm、QK‑Norm 与 z‑loss,训练数据为 FineWeb‑Edu),仅将模型几何结构改为深而薄的 23 层 × 576 隐藏维度。更大的模型在所有评测上都有提升:BLiMP 从 78.1 提升到 81.3,ARC‑Easy 从 51.4 提升到 52.5,WikiText‑2 字节困惑度从 2.04 降至 1.95。81.3% 的 BLiMP 分数几乎等同于 GPT‑X2‑125M(81.28),但参数量少约 12%。值得注意的是,110M 模型使用的训练标记更少(约 8B 而非 12B),因此收益来源于容量和深度,而非更多数据。两者均采用传统设计,这份报告提供了一个干净的尺度对照,作为后续消融研究的基线层(R0)。

消融梯度如下:R1 引入值残差,R2 使用 Muon 优化器,使 ARC‑Easy 累计提升 3.6 分(52.5→56.1),BLiMP 基本持平,这两项被保留。R3 的多样化数据混合以及 R4a/R4b 的两种 logits 蒸馏设置未被保留——属于诚实负例。R3 将 ARC‑Easy 锁定在 FineWeb‑Edu 的教育过滤上,而非原始多样性;从 1.7B 教师模型蒸馏可以将 ARC‑Easy 推至 56.99,匹配 GPT‑X2‑125M,但会以困惑度上升为代价,降低 KD 强度后优势消失——因此 R2 仍是最佳保留组合。

点评

原文链接: https://arxiv.org/abs/2609.14715

[h] 返回首页