NeFut Logo NeFut
EN 管理员登录

[AI学术] 掀起波澜的掩码感知策略梯度在扩散语言模型中的应用

发布于:2026-07-18 22:00 最后更新:2026-07-22 01:02
#algorithm #Machine Learning #optimization

摘要

强化学习已被证明能有效提升大型语言模型的推理能力,但将其扩展到掩码扩散语言模型(MDLMs)仍面临挑战,主要源于对对数似然估计的难以处理。现有方法通过仅建模标记预测来近似这一对数似然,忽视了在生成过程中解掩码的顺序。

我们观察到MDLM生成在每一步涉及两个决策:在每个掩码位置放置哪些标记,以及选择哪些位置重新掩码。我们将此形式化为一个两阶段动作马尔可夫决策过程(MDP),并展示策略梯度自然分解为标记项和掩码项。通过优化这两个项的结合,我们在数学推理和编码基准测试上取得了最先进的结果,其中GSM8K得分为87.1%,MBPP得分为53.4%。

博主点评: 本文提出的掩码感知策略梯度方法为MDLMs的生成过程提供了新的视角,通过优化掩码和标记的决策,显著提升了推理能力,值得在实际应用中进一步探索其潜力。

原文链接: https://arxiv.org/abs/2607.15200

[h] 返回首页