掩码扩散语言模型:强大且可控的智能体强化学习文本世界模型 Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL
用 MDLM 双向去噪打造可控文本世界模型,零样本提升 RL agent 达 47%
前置知识
World Model(世界模型)
一种参数化模型,用于近似环境的转移动力学。给定当前状态 $s_t$ 和动作 $a_t$,它预测下一状态 $s_{t+1}$,从而允许智能体在「想象」的轨迹上做规划或训练,而不必每次都访问真实环境。在视觉领域 DreamerV3 已证明单个配置可泛化到 150+ 任务,本文把它迁移到文本工具调用环境。
这是整篇论文的研究对象,理解它的形式化目标 $p_\theta(c_{t+1} \mid e_0, c_{\le t}, a_{\le t}; \mathcal{T}, \mathcal{R}, \mathcal{D})$ 才能理解为什么 MDLM 更合适。
Masked Diffusion Language Model(MDLM,掩码扩散语言模型)
MDLM 通过迭代去噪恢复被掩码的 token 来学习预测整段文本。训练时按扩散时间 $\tau \sim U(0,1]$ 以概率 $\tau$ 把每个 token 替换成 [M],再学习还原;推理时所有掩码位置可并行预测、双向注意。它的目标等价于任意顺序自回归似然的上界,因此天然支持条件在任意已知位置上的填充。
本文核心论点是 MDLM 的双向 anchor-aware 去噪能解决 AR 模型的 left-to-right bias,是全文方法基石。
GRPO(Group Relative Policy Optimization)
基于群体相对策略优化的强化学习算法,用二值可验证奖励对 LLM 做后训练,不依赖 critic 网络。它在 batched rollouts 上训练,因此对环境模拟器的吞吐和多样性非常敏感,rollout 质量直接决定梯度信号。
本文下游实验全部基于 GRPO,MDLM 作为世界模型为它生成 rollout,rollout 的保真度和多样性直接转化为 agent 性能提升。
Anchor-aware generation(锚点感知生成)
文本环境状态里有些字段(如 ticket_id、trailing status: "error")由 schema 或历史决定、被固定,称为「锚点」。AR 模型只能从左到右解码,无法看到尾部的锚点;MDLM 可同时注意到两侧锚点再决定如何填充,从而产生全局一致的样本(如 Figure 1 中 status: "error" 锚点要求 error_code 非空、refund_processed 不能为 true)。
Figure 1 全图都在讲这个概念,是论文的根本 motivation,也是 Table 1 MAUVE 差距的理论解释。
Prefix mode collapse(前缀模式塌缩)
模式塌缩指模型只生成少数几种开头或模式。AR 解码器容易陷入前缀模式塌缩——高概率的开头 token 一旦确定,后续决策都被约束。MDLM 因为同时采样「填什么 token」和「先填哪个位置」,能避免集中到窄前缀模式,这是 AR 解码器不具备的自由度。
论文用 Self-BLEU、Distinct-N 等多样性指标(Table 2)验证这一点,是 MDLM 在 RL 训练中更有价值的关键原因。
Self-BLEU / Distinct-N / MAUVE
Self-BLEU 衡量生成样本之间的 n-gram 重叠(越低越多样),Distinct-N 衡量 unique n-gram 比例(越高越多样),MAUVE 在 embedding 空间衡量生成分布与参考分布的对齐度(对表面变化不敏感)。论文认为这些比 exact-match 更适合评估世界模型,因为同一状态可有多种合法表示。
Table 1/2 的核心指标,理解指标语义才能判断「为什么 MDLM 赢了」。
研究动机
随着 RL 后训练技术成熟,训练 agent 需要大量多样化的环境,但主流环境都是手工设计、静态且难度固定——一旦模型在某领域提升,奖励信号就变得稀疏,rollout 中能遇到的情形变少,agent 容易过拟合特定工作流或工具结构,陷入 mode collapse。课程学习、域随机化、过程化内容生成虽然能增加 inter-episode 多样性,但每个 episode 内环境仍固定,无法做 intra-episode 自适应。更关键的是,最近出现的文本世界模型基于 AR LLM,受制于从左到右的解码偏置:环境状态字段之间存在全局相互依赖(工具 schema、前序轮次、预期结果),而因果模型架构上只能基于前文条件化,无法可靠锚定到尾部已知字段(如 status: "error"),因此容易产生 prefix-consistent 但 globally incoherent 的输出(如 refund_processed: true 配 status: "error"),即所谓幻觉。
本文的目标是本文希望系统性地研究掩码扩散语言模型(MDLM)能否作为更强大、更可控的文本世界模型来支撑 agentic RL。具体目标包括:(1) 把文本世界建模形式化为可控转移动力学问题,分解为初始环境状态 $e_0$、任务上下文 $c_t$、工具 schema $\mathcal{T}$、领域规则 $\mathcal{R}$、steering 指令 $\mathcal{D}$ 五个分量;(2) 用 12 个前沿模型族、9 个开源环境整理 239,403 条接地状态-动作轨迹的基准数据集;(3) 对比 MDLM 与 AR LM 在领域内外的生成保真度与多样性;(4) 在 ScienceWorld、ALFWorld、AppWorld 三个完全 OOD 环境上做零样本迁移,验证 MDLM 生成 rollout 能否提升 1.2B–7B agent 的下游任务成功率;(5) 用人工评估补充验证真实性、结果正确性和训练价值,并分析失效模式。
与已有工作不同的是,论文的独特切入点在于「双向 anchor-aware 去噪」。已有文本世界模型工作要么用 AR LLM(受 left-to-right bias 限制、易幻觉),要么用端到端 agent 流水线生成任务/工具/奖励(级联错误、难扩展、难 steering)。MDLM 虽在视觉世界模型中是标配,但作为文本环境模拟器从未被系统评估过。作者假设 MDLM 的去噪训练目标能学到状态空间上平滑、结构化的分布,并行预测掩码位置避免了 AR 模型「后续 token 基于已幻觉前缀」造成的状态内误差累积;同时它等价于任意顺序 AR 似然上界,可从同一训练信号学到所有条件方向,因此在参数远小于 AR 模型(4× 以上差距)的情况下仍能取得更高的一致性、接地性和多样性。
核心方法
整体思路是「先把世界模型当可控转移动力学问题来形式化,再让 MDLM 学这个条件分布」。论文把每个状态分解为 $s_t = (e_t, c_t, \mathcal{T}, \mathcal{R}, \mathcal{D})$,世界模型学 $p_\theta(c_{t+1} \mid e_0, c_{\le t}, a_{\le t}; \mathcal{T}, \mathcal{R}, \mathcal{D})$,其中 $\mathcal{T}, \mathcal{R}, \mathcal{D}$ 在轨迹内固定。环境状态 $e_{\le t}$ 被模型内部维护而非输出,避免上下文污染。每个 $s_t$ 序列化为 token 序列,模型在结构化 token 序列上学条件分布。技术路线上,MDLM 用前向加噪(每 token 以概率 $\tau$ 替换为 [M])+ 反向去噪(基于未掩码上下文和过去状态动作预测)来学习这个分布;数据集用 12 个前沿模型在 9 个环境生成 239,403 条轨迹,再经长度多样化(middle truncation + sub-trajectory extraction)和 Claude-4.6-Sonnet 合成的 hindsight grounding 增强;下游通过 plug-and-play GRPO + 确定性状态检查把世界模型接进 agent 训练。
核心创新是利用 MDLM 的双向 attention 同时观察到左右两侧的 anchor 字段后再去噪掩码位置,从而生成全局一致的样本。这与 AR 模型有本质区别:AR 因子分解 $\prod_i p(x_i \mid x_{<i})$ 被强制一个固定顺序,而 MDLM 目标等价于任意顺序 AR 似然上界,能从同一训练信号学到所有条件方向。此外 MDLM 并行预测共享上下文下的掩码 token,消除了 AR 模型「后续 token 基于已幻觉前缀」造成的状态内误差累积;MDLM 的迭代去噪还同时采样「填什么 token」和「先填哪个位置」,这是 AR 解码器不具备的自由度(AR 必须总是填最左未填位置),从而避免集中到窄前缀模式、带来更高的 rollout 多样性。作者专门用 Qwen3-8B 作对照基线来隔离「扩散目标」本身相对「基座容量」的贡献。
方法步骤详情
步骤如下:(1) 轨迹生成——在每个原始环境上用 12 个前沿模型(Qwen-3.5-4B/9B/397B-A17B-FP8、GPT-5.4-mini/5.4、GPT-OSS-120B、Claude-4.6-Sonnet、Claude-4.5-Haiku、Gemini-3-Pro、MiniMax-M2.1、GLM-5、DeepSeek-V3.2,按 seed 42 均匀随机选)跑完整 rollout;(2) 长度多样化——超过 16,384 token 的轨迹做 middle truncation,保留系统/用户提示和最后 $N \sim U(0, N_{\max})$ 轮,$N_{\max} = (T_{\max} - T_{\text{sys}} - T_{\text{user}})/\bar{t}$,删除部分用 [TRUNCATED ...] 占位;其余轨迹以 15% 概率在工具调用边界截断做 sub-trajectory extraction;(3) 状态接地——用 Claude-4.6-Sonnet 高推理模式合成环境状态、工具 schema、领域规则、steering 指令(约 80% 数据增强,并注入无关 DB 行等噪声训练选择性注意),未增强占 17.2%;(4) 训练——AdamW($\beta_1=0.9, \beta_2=0.95/0.99$,clip=1.0)、余弦 warmup、最大序列长 16,384,对学习率 $\{10^{-6}, 5\times10^{-6}, 10^{-5}, 5\times10^{-5}\}$ 与 batch size $\{1,2,4,8\}$ 做 sweep,每实验 3 个种子 {42, 7000, 9000} 取均值;AR 用 ms-swift,SDAR/LLaDA 用 dFactory,WeDLM 用官方训练代码 + MagiAttention;(5) 推理——lmdeploy 服务,repetition penalty=1.3,diffusion steps 在 {1,25,50,100} 中选 50,SDAR block size=4,LLaDA-2.1 block size=32;(6) 下游 GRPO——SDAR-8B 作世界模型在 AppWorld/ScienceWorld/ALFWorld 上做 rollout,真实环境给奖励。
技术新颖性
新颖性体现在三方面。第一,这是首次系统性地把 MDLM 当文本世界模型评估,填补了扩散世界模型在离散文本侧的研究空白——此前只有视觉侧用过扩散。第二,提出可控转移动力学的五分量形式化($e_0, c_t, \mathcal{T}, \mathcal{R}, \mathcal{D}$)+ 确定性状态检查的 plug-and-play GRPO 框架,使得 MDLM 的优势能直接转化为 agent 训练收益,且不需要像 Li et al. (2025) 那样对每个下游环境做专门微调(论文实现零样本迁移)。第三,通过 Qwen3-8B 基线隔离出「扩散目标 vs. 基座容量」的贡献,证明 in-domain MAUVE 提升 +.283 完全来自扩散目标本身,而非参数或数据,这把因果归纳偏置定位为「LLM 世界建模的主要瓶颈」。论文还把 239,403 条轨迹数据集(9 环境、12 模型族)和代码全部开源,为社区提供可复现基线。
实验结果
RQ1(生成保真度,Table 1):零样本下 SDAR-30B-A3B 在 4 个 split 中 3 个取得最佳 MAUVE,API-BANK 上 .697 vs GLM-4.7-Flash 的 .532,in-domain 上 .261 vs .232;3-shot 缩小但未关闭差距(GLM-4.7-Flash 和 Nemotron-3-Nano-30B 在 API-Bank 这类确定性集上能追平 SDAR-30B);微调后 MDLM 全面压制——SDAR-8B(比 Qwen3.5-35B-A3B 小 4×+)在 in-domain MAUVE 达 .982(vs .932)、OccuBench MAUVE .979(vs .960),3-shot SDAR-30B-A3B 把 in-domain MAUVE 推到 .995。Qwen3-8B 基线隔离显示 SDAR-8B 的 in-domain MAUVE 比它高 +.283,证明收益来自扩散目标。RQ1'(多样性,Table 2):SDAR-8B 取最低 Self-BLEU .601、最高 Distinct-N .385、最高 MAUVE .900,验证 MDLM 覆盖更多合理下一状态分布。RQ2(下游,Table 3):9 个 model-env 对上 SDAR-WM 全部优于 SFT-only 和 Qwen-WM,LFM2.5-1.2B 在 ALFWorld 从 5.7% → 53.6%(+47.9 绝对),Mistral-7B 在 ScienceWorld 从 3.3% → 48.4%(+45.1,比 Qwen-WM 高 15.1 分),平均 SDAR-WM 比 Qwen-WM 高 +5.3 分,且全程零样本(OOD 环境未参与训练)。RQ3(人工评估,Table 4):4 位行业专家打 1-5 分,真实性 4.75、结果正确性 4.25、训练价值 4.50,Krippendorff's α 全部 > 0.89,标注一致性强。行为分析(Appendix H):MDLM 对 steering 顺序基本无感、能在参数空间做基础 DB join、对不可行任务仍输出非退化状态,但存在 pagination drift 和 block-level 重复。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| In-domain next-state generation (Table 1, finetuned) | MAUVE (↑) | SDAR-8B: 0.982;3-shot SDAR-30B-A3B: 0.995 | Qwen3.5-35B-A3B: 0.932(最佳 AR) | SDAR-8B 在比对手小 4×+ 时 +0.050;3-shot 进一步到 .995 |
| OccuBench next-state generation (Table 1, finetuned) | MAUVE (↑) | SDAR-8B: 0.979 | Qwen3.5-35B-A3B: 0.960 | +0.019 MAUVE,且 SDAR-8B 体积小 4×+ |
| ALFWorld 任务成功率 (Table 3, LFM2.5-1.2B) | Task Success Rate (↑) | SFT + RL w/ SDAR-WM: 53.6% | Base: 5.7%;SFT only: 42.9%;SFT + RL w/ Qwen-WM: 48.6% | 相对 base +47.9 绝对,相对 Qwen-WM +5.0 |
| ScienceWorld 任务成功率 (Table 3, Mistral-7B-v0.3) | Task Success Rate (↑) | SFT + RL w/ SDAR-WM: 48.4% | Base: 3.3%;SFT only: 23.3%;SFT + RL w/ Qwen-WM: 33.3% | 相对 base +45.1 绝对,相对 Qwen-WM +15.1 |
| AppWorld 任务成功率 (Table 3, Mistral-7B-v0.3) | Task Success Rate (↑) | SFT + RL w/ SDAR-WM: 71.2% | Base: 51.3%;SFT only: 63.8%;SFT + RL w/ Qwen-WM: 69.2% | 相对 base +19.9 绝对,相对 Qwen-WM +2.0 |
| Rollout 多样性 (Table 2, finetuned) | Self-BLEU (↓) / Distinct-N (↑) / MAUVE (↑) | SDAR-8B: 0.601 / 0.385 / 0.902 | Qwen3.5-35B-A3B: 0.690 / 0.253 / 0.889 | Self-BLEU −0.089、Distinct-N +0.132、MAUVE +0.013,全面更优 |
| 人工评估 (Table 4, SDAR-8B) | 1-5 Likert Mean / Krippendorff α | Realism 4.75 / Outcome 4.25 / Utility 4.50(α≥0.89) | 无对应 AR 基线(仅 MDLM 评估) | 三个维度均接近 5 分且标注高度一致 |
局限与改进
作者明确承认两类持久失效模式:(1) MDLM 难以生成良好且一致的 API key(推测是 Qwen 基座安全对齐 + 小 block size 导致的重复);(2) 当工具要求枚举多页输出时存在 pagination drift(Table 7 (i) 显示 page_index=1 返回和 page 0 同样的 ID)。其他失效包括:当工具要输出整个数据库状态(如 get_all_queries)且无 repetition penalty 时退化成重复;高温下出现 block-level 重复;in-domain 自评数据集还是用合成模型生成的,可能引入分布偏置;下游 agent 表现虽大增但仍远非上限(ALFWorld 53.6% 仍有提升空间)。我自己的观察:所有 MDLM(SDAR、WeDLM、LLaDA-2.1)都构建在 Qwen 系列权重上,因此结果可能部分受基座影响;BLEU/ROUGE 在 JSON 上必须做规范化(key 排序、剥白空、数字归一)才能公平比较(Appendix B),说明评估对预处理敏感;人工评估只有 4 个标注者 100 个样本,规模偏小;AR 模型在 verbose 任务下退化为幻觉而非重复,论文未给出系统量化对比。
独立分析的弱点
弱点一:结构化字段生成脆弱。API key、numeric type coercion(string vs integer/float)等出错率较高,人工评估标注者多次提到;改进方向是引入 schema-constrained decoding,或在扩散解码时加入格式化奖励项。弱点二:长 verbose 工具输出下出现 block-level 重复和 pagination drift;改进方向是用更大 block size 训练专门的 tool-use MDLM 后训练,或用确定性 responder 路由列表/搜索类工具(作者已在 AppWorld 中部分这么做,把 mutation 工具直接返回 {"status":"success"})。弱点三:多样性优势主要在零样本和参数等量对比下显著,但和 35B AR 模型在 BLEU/ROUGE 上仍只是 competitive 而非完全压制;改进方向是 scaling MDLM 到 30B+ dense 或更大 MoE。弱点四:所有下游 RL 提升都是相对弱小 agent(1.2B-7B)和相对短任务,没有验证大规模 long-horizon agent;改进方向是把 SDAR-WM 接到 70B+ agent 上做多轮工具链任务。弱点五:评估指标偏 surface form(BLEU/ROUGE/MAUVE),未来需要更多语义等价测试和 end-to-end agent 性能指标。
未来方向
作者明确提出的方向:研究世界模型的 steering、robustness 和 reward hacking 倾向,以及通过世界模型可能注入下游模型的 bias。基于成果可延伸:(1) 把 block diffusion 推广到 tool-use 专门后训练的 MDLM,系统性解决 API key 和 pagination drift;(2) 探索 MDLM 在视频/多模态世界模型的统一(论文已在 related work 提及扩散视觉世界模型,文本侧与视觉侧扩散的统一是自然方向);(3) 把数据集从 9 环境扩展到更多真实企业环境(除 TauBench 外的金融/医疗)和更长 horizon 任务;(4) 把 steering 从静态 schema 扩展到动态对抗性 steering,做 curriculum learning;(5) 研究 AR + MDLM 混合:AR 写代码、MDLM 模拟状态,取长补短;(6) 沿 Li et al. (2024) 的 in-world RL 思路,把 MDLM 推到完全 imaginative world 训练(不依赖任何真实环境);(7) 研究扩散步骤数与质量-延迟曲线的 Pareto 前沿(论文观察到 25→100 步质量无差异,可压缩)。
复现评估
复现性总体较高。作者开源了数据集(HuggingFace PatronusAI/world_model_corpus)和训练代码(GitHub patronus-ai/mdlm_world_modeling),写了详细的训练超参(学习率 sweep、种子 {42, 7000, 9000}、batch size、梯度累积 8)、推理设置(lmdeploy、block size、diffusion steps=50、repetition penalty=1.3)和各环境 prompt(Appendix G 把 ALFWorld/AppWorld/ScienceWorld 的完整 system prompt 全部贴出)。算力需求是 8×H100 做所有 RL 和世界模型训练,Mistral-7B 还要 DeepSpeed ZeRO-2 多卡——对学术小实验室不算便宜但仍可承受。复现难点:(1) 12 个前沿模型生成 239,403 条轨迹的成本不低(GPT-5.4、Claude-4.6-Sonnet、Gemini-3-Pro 的 API 费用),所幸数据集已开源;(2) Qwen3-8B 基线虽然隔离了扩散贡献,但 MDLM 系列都依赖 Qwen 系列权重,迁移到非 Qwen 基座的 MDLM 是否仍有同样收益需要验证;(3) 人工评估环节依赖 Upwork 招募的 4 位专家,难以严格复现标注一致性(虽然 α≥0.89 已说明内部可靠);(4) Appendix C 的 hindsight instruction synthesis prompt 完整给出,对数据复现有帮助。总体评分:开源程度高、文档详尽、超参完整,属可复现级别,主要门槛在 API 费用和 GPU 资源。
论文图表
下游 RL 主表,三个 agent 骨干(LFM2.5-1.2B、Qwen3-4B、Mistral-7B-v0.3)在 AppWorld、ScienceWorld*、ALFWorld*(带*为强制部分可观测)上的任务成功率,对比四种方法:Base、SFT only、SFT+RL w/ Qwen-WM、SFT+RL w/ SDAR-WM。9 个 model-env 对中 SDAR-WM 全部最优,最大提升出现在 ALFWorld(LFM2.5 5.7%→53.6%)、ScienceWorld(Mistral-7B 3.3%→48.4%),平均 SDAR-WM 比 Qwen-WM 高 +5.3 分,且全程零样本迁移(这三个环境不参与训练)。
这是 RQ2 的核心证据,回答「世界模型质量能否转化为 agent 性能」,是论文最 impactful 的结果——证明小 MDLM 世界模型在 OOD 环境上零样本提升 agent 达 47%。