摘要
掩码扩散语言模型(MDLMs)正在迅速发展,但用于可靠解读其进展的评估标准尚未同步跟上。尽管MDLMs已与自回归语言模型竞争,但七篇近期的重掩码论文在不兼容的设置下进行评估,变动的名义步数、指标和采样温度未能共同控制,导致其策略排名大多不可比,并且尚不清楚报告的提升是否反映算法改进或评估伪影。
我们提出了CaRE,一个计算感知的评估框架,通过标准化实际的函数评估次数(NFE)、强制多指标报告和明确控制随机性来审计MDLM重掩码策略。应用于LLaDA-8B-Base和Dream-7B-Base的7种重掩码策略,设置4个随机性级别和3个步数预算,使用OpenWebText和LM1B数据集,CaRE揭示了以下几点:
- 温度解释了MAUVE方差的大部分。
- 计算匹配比较反转了几个已发布的策略排名。
- 有信息的重掩码与随机解掩码之间存在张力,高熵重掩码在unmask_temp=0.25时,在256步下将MAUVE降低了0.296(p=0.020)。
一个覆盖12个开源权重MDLM(150M到8B参数)的CaRE排行榜显示,这种交互方向在不同架构和规模上保持一致。这些发现表明,当前MDLM的评估可能系统性地将算法改进与计算和随机性的隐含选择混淆。我们发布了评估协议、实现和排行榜,以确保未来的重掩码声明具有可重复性和可比性。
博主点评: CaRE框架的提出为掩码扩散语言模型的评估提供了一种系统性的方法,解决了当前评估标准不一致的问题。通过标准化评估过程,研究者能够更准确地比较不同算法的性能,避免了因随机性和计算资源选择造成的误解。这一进展为MDLM领域的研究提供了重要的基础。