NeFut Logo NeFut
EN 管理员登录

[AI学术] 标记边界的代价:压缩证书与预测

发布于:2026-09-30 22:00 最后更新:2026-10-06 12:11
#algorithm #AI #Machine Learning

预分词(pre‑tokenisation)限制了哪些文本片段可以成为预测单元,但当只在相同边界下比较分词器时,其压缩代价往往被掩盖。我们通过在有无正则表达式边界规则的情况下,对最小标记数进行双向界定来度量这部分代价。

对标记出现次数赋予非负价格,可通过最短路径和词表预算选择得到下界;对所有价格取最大值则恢复线性规划松弛形式,而独立的整数检查器能够验证报告的数值。

在英文维基百科数据上,加入边界会使最优标记数增加 28.3%–36.8%。字节对(Byte Pair Encoding)比受约束的下界高出 2.1%,但比无约束下界高出 10.9%。压缩与预测倾向于不同的词典:在 8500 万非嵌入参数且训练标记预算相同的条件下,未受约束的拟合在所有 12 种语言的配对实验中均获得更高的每字节平均持出比特数,在独立调参与评估的 12 种语言中有 11 种表现更佳。

为研究中间边界策略,我们引入了 边界许可证(boundary licences),该机制限制可以跨越切分的词表条目,并同样支持证书形式。分别在英文和中文的拟合语料上,许可 10% 的词表预算即可恢复去除所有切分后标记数降低的 85.2%(英文)和 100.0%(中文)。

这些实验量化了边界的压缩成本,并将其与由此产生的标记单元的预测质量区分开来。

点评

原文链接: https://arxiv.org/abs/2609.35869

[h] 返回首页