NeFut Logo NeFut
EN 管理员登录

[AI学术] 掀起风暴的文本基础世界模型:Masked Diffusion 语言模型在代理强化学习中的应用

发布于:2026-07-21 22:00 最后更新:2026-07-22 01:01
#algorithm #Open Source #Reinforcement Learning

摘要

近期强化学习(RL)的发展迫切需要多样化、专业化的训练环境。手动设计的环境随着模型性能的提升逐渐失效,而在较长的时间跨度内稀疏的奖励会导致特定工作流或工具结构的模式崩溃。模拟环境状态的世界模型在纯滚动性能上已经达到了理想效果,为按需扩展多样性提供了希望。

然而,自回归(AR)世界模型由于左到右的偏差,无法对全局互依的状态锚进行条件化,例如工具模式、之前的回合和预期结果。

我们将文本基础的世界建模形式化为可引导的过渡动态问题,分解为初始状态、任务上下文、工具模式、领域规则和引导指令。我们整理了239,403个基础状态-动作轨迹,涵盖九个开源环境和十二个前沿模型系列。

我们比较了AR LMs与Masked Diffusion语言模型(MDLMs),结果显示MDLMs通过双向锚感知去噪,取得了比LLMs更好的连贯性、基础性和经验证的滚动多样性,其参数量超过LLMs的4倍,同时保持相当的推理延迟。

我们提出了一种即插即用的GRPO训练框架,结合确定性状态检查,并在三个OOD环境(ScienceWorld、ALFWorld、AppWorld)上对三种1.2B-7B代理骨干(LFM2.5、Qwen3、Mistral)进行了零-shot转移消融实验,获得了高达47%的绝对增益,且无需环境特定的微调。

此外,我们在对抗场景下进行了失败模式的行为分析,并对现实性、结果正确性和训练效用进行了人工评估。我们开源了我们的工作,以鼓励在此方向上的研究。

博主点评: 本文展示了Masked Diffusion语言模型在强化学习中的潜力,尤其是在应对复杂环境和多样化任务时的优势。通过对比分析,清晰地揭示了MDLMs在性能和灵活性上的提升,值得在实际应用中进一步探索和验证。

原文链接: https://arxiv.org/abs/2607.16204

[h] 返回首页