在本文中,我们介绍了一种新的扩散语言模型——令牌时间连续扩散(TTCD)。该模型具有以下特点:
-
连续空间操作:TTCD 在连续空间中运行,确定性地将高斯噪声映射到最终的令牌画布,而不需要进一步的采样。
-
每个令牌的时间概念:TTCD 引入了一种新的每个令牌时间的概念,使得某些令牌从噪声到令牌的转变速度快于其他令牌。
连续空间建模使 TTCD 能够避免在多个令牌的并行采样中产生的误差,这在高加速时尤其关键。
每个令牌时间的概念帮助 TTCD 更好地建模条件生成,允许更多的确定性令牌以更快的速度进行生成,并在精细化过程中实现令牌间的差异化影响。
TTCD 在高加速情况下的表现优于离散模型。我们在 OpenWebText 上训练了一个包含 1.6 亿参数的 TTCD 模型,并进行了自蒸馏。结果表明,在高加速情况下,我们的无条件生成质量与其他相似规模的现有模型相当,而在条件生成方面表现更佳。
我们在数独解题中也取得了类似的进展。
博主点评: TTCD 通过引入连续空间和每个令牌的时间概念,显著提升了语言模型的生成效率与质量,展现了未来语言建模的新方向,值得关注与深入研究。