统一离散扩散模型(UDM)通常在输入中显式加入时间 $t$ 作为条件,但实际使用中这一步骤往往并非必需。本文首先证明,总体最优的 UDM 预测器一般会依赖时间:时间决定模型对已观测上下文的信任程度,可形式化为 $$\hat{y}_t = f(x, t)$$,其中 $t$ 调节权重 $w(t)$,使得在噪声较低时更依赖上下文,在噪声较高时更倾向于先验。随后我们指出,在语言任务的有限数据场景下,这种依赖性可以变得可以忽略。当一个被扰动的训练序列 $\tilde{x}$ 与其原始干净序列 $x$ 的距离远小于与其他训练序列的距离时,经验最优预测器在扩散轨迹的大部分区间对时间几乎不敏感,只有在高噪声端点附近才会出现显著变化。实验上,训练得到的语言 UDM 在大多数扩散步骤上表现出有限的时间敏感性,而不使用时间条件的预测器在多个数据集和训练目标上仍能与甚至超越显式时间条件模型的表现。点评:这些发现表明,尽管理论上总体最优解依赖时间,但在实际语言建模中显式加入时间条件往往是多余的,可简化模型设计并降低计算开销。