摘要
离散掩码扩散语言模型支持双向生成和填充,但将预训练的自回归(AR)变换器适配于此需要调和因果预训练与双向去噪的问题。我们在注意力层面研究这一问题,而不是声称AR权重重用本身是新颖的。PreDiff-LM在观察到的提示中保留因果注意力,同时允许在掩码目标内进行完全的双向注意力。
在匹配的GPT-2 Medium、WikiText-103和90K步的设置下,这种混合掩码将无条件困惑度从34.1降低到28.7,MAUVE从0.71提升至0.78,相比于使用相同AR初始化的均匀双向注意力。注意力适配还与DiffuGPT风格的目标适配相结合,使困惑度达到26.9。预训练初始化将困惑度降至50以下所需的步骤从约350K减少到8K,尽管在相等规模下,计算匹配的微调AR模型仍然更强(18.9对28.7)。
除了困惑度,PreDiff-LM还改善了重复性、分布质量、四个零样本下游任务和人类偏好,优于先前的扩散基线。这些结果将混合注意力定位为适配预训练因果骨干的补充机制,同时明确了与优化后的AR模型之间仍然存在的质量和推理效率差距。
博主点评: PreDiff-LM展示了混合注意力在语言模型中的潜力,通过有效结合因果与双向注意力,显著提升了模型性能。尽管在计算效率上仍有待提高,但其在实际应用中的表现值得关注,尤其是在零样本任务中的优势。