NeFut Logo NeFut
EN 管理员登录

[AI学术] 突破性改进:为预训练大型语言模型实现就地分词扩展

发布于:2026-07-19 22:00 最后更新:2026-07-22 01:02
#algorithm #Machine Learning #Open Source

在预训练大型语言模型(LLMs)中,固定的分词器在预训练开始时分配词汇表,依赖于当时的预训练语料库及其部署优先级。随着优先级的变化,后期添加的语言往往被拆分为更多的词元,这会增加用户在使用这些语言时的延迟、计算和能耗。云模型可以承受较大的词汇量,因为嵌入和语言模型头矩阵只占其参数的很小一部分。而对于紧凑型模型,这些矩阵则占用了每个词元解码带宽的较大份额,因此在设备上的模型通常会使用较小的词汇量,并在固定语言集外接受词元碎片化。

我们提出了一种分词器扩展的方法,能够在模型生产者控制设计的情况下,升级预训练模型的分词器。该方法在多语言语料库上继续现有分词器的BPE合并,使大部分源词元保持不变为单个词元,同时每个新词元都有确切的源词元分解。我们保持不变复制已转移的嵌入行,并将新行初始化为其源子词嵌入的均值。通过嵌入-only 训练和全模型继续预训练的两阶段适应,恢复源检查点的质量。我们将该方法应用于LFM2-8B-A1B的继续预训练检查点,这是一个具有8B参数的混合专家模型,以帮助生成LFM2.5-8B-A1B,使用128K的分词器。扩展后的分词器在编码印地语和越南语时,分别减少了约 $2.4\times$ 和 $2.6\times$ 的词元数量(泰语减少可达 $4.0\times$)。结合这些减少与更大词汇量的每个词元成本,我们估计在我们的参考设备上,这些语言的每字符解码速度可以提升 $2.2$-$3.7\times$。我们发布了模型权重和扩展的分词器,并报告了影响该方法的负面发现。

博主点评: 这项研究为大型语言模型的应用提供了重要的优化策略,通过改进分词器设计,不仅提升了多语言支持的效率,还有效降低了计算资源的消耗。其在实际应用中的潜力值得深入探讨。

原文链接: https://arxiv.org/abs/2607.15232

[h] 返回首页