多轮长程规划的物理学:从预训练经单/多教师在线策略智能体蒸馏的后训练 The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation
用可控环境系统揭示长程规划能力在预训练、GRPO/OPD、多教师蒸馏三阶段的获取、塑造与整合规律。
前置知识
世界模型 (World Model)
世界模型刻画环境的状态转移规律,用状态转移函数 $\mathcal{T}: \mathcal{S} \times \mathcal{A} \to \mathcal{S}$ 表示——给定当前状态 $s_t$ 与动作 $a_t$,预测下一状态 $s_{t+1}$。在本文中,世界模型并非外挂模块,而是被内化进思维链 (CoT):模型先在内部 CoT 中模拟「执行某技能序列后状态如何变化」(如 DFS 节点展开 $s_{t+1} = f_{k_{t,m_t}} \circ \cdots \circ f_{k_{t,1}}(s_t)$),再输出可执行动作。
本文第一大结论就是「内化世界模型 vs 直接动作预测」对长程泛化能力的天壤之别,不理解世界模型就抓不住预训练阶段的核心。
在线策略智能体蒸馏 (On-Policy Agentic Distillation, OPD)
OPD 让学生在自己采样得到的多轮交互轨迹 $\tau = (g, s_0, \hat{Y}_1, s_1, \ldots, \hat{Y}_K, s_K) \sim \pi_\theta$ 上学习,教师与学生逐 token 计算下一 token 分布的逆 KL 散度,损失可精确分解为 $\mathcal{L}_{\text{Agent-OPD}}(\theta) = \mathbb{E}_{\tau \sim \pi_\theta}\left[\sum_{k=1}^{K}\sum_{t=1}^{T_k} D_{\mathrm{KL}}(p_{k,t} \| q_{k,t})\right]$。本文用的是 Top-$k$ OPD($k{=}100$),即在学生 top-$k$ 词表子集上做截断重归一化后算 KL,提供比结局奖励稠密得多的逐步监督。
OPD 是后训练阶段的核心算法,论文核心命题之一就是「在长程+低质数据下,OPD 比 GRPO 有效区间更大」,必须先懂其 token 级监督机制。
群体相对策略优化 (GRPO)
GRPO 是主流 RL 后训练算法:对同一 prompt 采样一组轨迹,用组内相对优势去均值作为优势估计,再用 outcome reward(本文是二值的最终成败奖励)做策略梯度更新。它本质上是稀疏的结局奖励,所有 token 共享一个优势值。
论文把 GRPO 当作对照基线,论证其在长程、低质数据场景下因「稀疏信用分配」而失效,是理解三区域理论的关键反例。
规划模式 vs 规划知识 (Planning Pattern vs Planning Knowledge)
作者用互信息区分两类输出:规划模式 $P$ 是跨任务通用的 CoT 骨架(如反思、回溯、目标分解),与任务 $T$ 关系弱,互信息 $I(T;P)$ 小;规划知识 $K$ 是任务特定的过程性配方(如「水+草籽+羊=羊毛」),与 $T$ 强相关,$I(T;K)$ 大,且 $I(T;P) < I(T;K)$。低互信息意味着不同样本优化方向一致、易泛化;高互信息意味着需逐样本精调。
这是全文最具洞察力的分析框架——它直接推导出三区域(unnecessary/effective/unsupported)和「知识不能靠 RL 蒸」等核心结论。
灾难性遗忘与持续学习 (Catastrophic Forgetting / Continual Learning)
在多教师级联训练中,新教师的能力可能覆盖旧教师学到的能力。若各环境共享兼容的规划模式,学生能持续学习而不遗忘;若模式完全冲突,学生会过拟合到新教师、把旧域性能打回原形,即灾难性遗忘。本文用 PCA 空间与参数 L2 距离直观展示了 MOPD 只在 Instruct 附近做小幅扰动。
第三阶段(MOPD)的全部三种模式(泛化/持续/冲突)都围绕「模式是否共享与兼容」展开,是理解整合阶段的基础。
研究动机
多轮长程规划是基础模型走向通用智能体的关键能力——OSWorld 2.0、EdgeBench、Long-Horizon-Terminal-Bench、DeepPlanning 等基准都表明,当前大模型在短程规划上还行,但面对 9 步以上的长程任务几乎崩溃。然而「这种能力到底从哪来、又该如何强化」是个黑盒:现有模型都训练在不透明、不可控的互联网语料上,无法拆解清楚「规划能力是预训练时就已具备,还是后训练才被激活」,更无法系统分析数据格式、数据分布、数据质量各自的影响。比如在 GRPO vs OPD 的选择上、在多教师蒸馏能否跨环境迁移上,业界只有经验性结果而缺乏机理性解释。MiMo-V2-Flash、GLM-5、Nemotron-Cascade 2、DeepSeek-V4 都在用 MOPD,却没人说清它在什么条件下有效、什么条件下反而有害。
本文的目标是作者要在一个统一可控的多轮环境里,把长程规划能力的「获取—塑造—整合」三阶段彻底拆开研究,给出可量化的、机理性的结论。具体目标包括:(1) 预训练阶段——定量回答「世界模型 vs 直接预测」「原子技能能否自动组合」「次优轨迹危害多大」;(2) 后训练阶段——画出 GRPO 与 OPD 的「适用边界图」,区分规划模式与规划知识两类对象的不同命运;(3) 多教师整合阶段——给出 MOPD 在「共享+兼容」「共享+冲突」「无共享+冲突」三种模式下的精确行为与失效条件。所有结论都建立在可复现的合成数据上,避免互联网语料的混淆变量。
与已有工作不同的是,本文最独特的切入点是「可控」。以往的「physics of LLM」类工作大多基于单轮数学推理,而本文专门设计了支持多轮长程规划的 Controllable Planning Gym——能精确控制环境数量、难度层级、任务步长、数据质量、规划知识、规划模式,且同时兼容 SFT 与 RL。基于此作者得以做大量反事实实验(如教师用 Recipe B 蒸馏只学过 Recipe A 的学生、人为注入 4 Opt : 8 Sub 次优轨迹、移除某个共享模板),从而把「模式」与「知识」用互信息这一信息论工具切割清楚。这种「把不可控的互联网预训练换成可追溯的合成预训练」的研究范式,是已有工作长期缺失的视角。
核心方法
直觉上,作者把规划能力当作「物理量」来测量:要研究它从哪来、怎么被塑造、怎么被整合,就得在一个「干净的实验舱」里逐变量地拨动旋钮。这个实验舱就是 Controllable Planning Gym——三大领域(Fantasy Alchemy 幻想炼金、Livestock Farming 畜牧养殖、Electronic Assembly 电子组装)各建成 5 层、每层 40 个类别、每类 20 个实例的层级技能图,合成规则用 AND/OR 逻辑表达 $v \Leftrightarrow (u_{1,1} \wedge \cdots) \vee \cdots$;再通过索引映射实例化成具体 gym,并按最少合成步数把任务切成 Short(1-5)/Middle(6-8)/Long(9+) 三档难度。技术上,作者随机初始化一个 Qwen2.5 架构的小模型、自训 byte-level BPE tokenizer,在 1.2B 合成语料上预训练,然后依次走 SFT→GRPO/OPD→MOPD 三阶段,每阶段都只拨动一个变量来观察规划能力的变化。
全文最核心的洞察是用互信息把「规划模式」与「规划知识」一分为二:模式 $I(T;P)$ 低、跨样本优化方向一致,适合用 RL/OPD 塑造;知识 $I(T;K)$ 高、需逐样本精调,RL 更新幅度太小、只能靠 SFT 注入。基于此划分,作者把后训练的应用空间沿「任务步长 × 数据质量」切成三区——unnecessary(不同模式表现相当,RL 多余)、effective(GRPO 与 OPD 都能涨)、unsupported(长程+低质,GRPO 因稀疏信用分配失效,只有 OPD 这类细粒度奖励能撑)。第二个核心创新是把 MOPD 的机理讲清楚:它的本质是 mode-seeking,让学生收敛到多教师共享的规划模式分布上,因此「共享且兼容」决定能否跨环境泛化、「完全冲突」必然导致灾难性遗忘。这套分析框架是已有 SFT/RL/MOPD 实证工作里被严重忽视的理论骨架。
方法步骤详情
完整流程分七步:(1) 用 LLM 生成类别树与物品实体,构建三大领域(炼金/畜牧/电子)的层级技能图,每域 5 层 40 类 20 实例,贪心最小化压住步数爆炸;(2) 索引映射实例化 gym,按最少合成步数切 Short(1-5)/Middle(6-8)/Long(9+) 三档并注入干扰物,部分索引留作测试集防泄漏;(3) 训练自研 byte-level BPE tokenizer;(4) 在 1.2B 语料上从零预训练 Qwen2.5 架构学生,输入「目标+库存+类别+历史」,输出交织 CoT 与 JSON 动作的统一序列;(5) 预训练三类消融——世界模型 vs 直接预测、S/M/L 配比(0%/5%/50%/100%)、最优/次优模板混合(4 Opt / 4 Opt:4 Sub / 4 Opt:8 Sub);(6) 单教师阶段跑多轮 GRPO(二值结局奖励)与多轮 Top-$k$ OPD($k{=}100$),做 SVD 梯度与 token 级 KL 机理分析;(7) 多教师阶段按 FA→LF→EA 级联蒸馏,对照 Form a/b/c/d 四种兼容/冲突设置,用 PCA 与 L2 刻画位移。评估每实例采样 8 次、限 20 步,报 avg@8 与 pass@8,单 checkpoint 最多 11520 次推理。
技术新颖性
技术新颖性有三点:其一,首次把「physics of LLM」从单轮数学推理推广到多轮长程规划,且环境完全可控、可反事实;其二,首次用互信息 $I(T;P) < I(T;K)$ 严格区分规划模式与规划知识,并据此推出三区域理论,解释了为什么 OPD 能撑住 GRPO 撑不住的长程低质场景、又为什么 OPD 蒸不进任务特定知识;其三,首次用「模式是否共享与兼容」三分类(Type I/II/III)刻画 MOPD 的成功/持续/失效边界,并通过 SVD 梯度方向、token 级 KL、参数 PCA 三类机理分析给出物理解释。这些区别于以往只做 SFT 数据合成、只调 RL 算法、只堆多教师工程的经验性工作。
实验结果
预训练三大发现:(1) 内化世界模型全面碾压直接预测——Long 档 avg@8 从约 26.1 涨到 71.9($\Delta{=}+45.8$),Short 仅 $\Delta{=}+9.4$;直接预测收敛快但天花板低。(2) 原子技能无法自动组合——仅 Short 100% 训练时 Middle/Long pass@8 几乎为 0(0.83%、0.00%),但加 5% Middle 轨迹 Middle pass@8 跳到 51.88%,加 5% Long 轨迹 Long pass@8 升到 11.46%。(3) 次优轨迹致命,4 Opt:8 Sub 让 Middle/Long 几乎归零,因误差累积放大。后训练:4 Opt 高质底座上 GRPO/OPD 都几乎不涨(unnecessary 区);但 4 Opt:8 Sub 上 OPD 把平均 avg@8 从 15.19 提到 33.61($\Delta{=}+18.42$),GRPO Mid 反而 $\Delta{=}-0.34$,印证 GRPO 长程低质失效、OPD 区间更大。知识蒸馏反直觉:用 Recipe B 教师蒸只学过 Recipe A 的学生,Teacher B 满分但学生 pass@8 仅 36.60,低于未蒸馏基线 44.03。多教师:共享+兼容下单蒸 FA 教师就把未见 LF 域 Middle avg@8 从 34.92 顶到 52.58;Form d 完全冲突时学完 EA 后 FA 域 Short avg@8 从 90.00 崩到 15.62。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 内化世界模型 vs 直接动作预测 (avg@8, Long 档) | avg@8 | 71.9 (w/ World Modeling) | 26.1 (w/o World Modeling) | +45.8 个百分点,长程泛化提升最显著 |
| 原子技能组合泛化 (Long pass@8) | pass@8 | 11.46 (100% Short+100% Middle+5% Long) | 0.00 (100% Short) | 仅注入 5% 长程轨迹即激活规划能力 |
| OPD vs GRPO 在低质底座 4 Opt:8 Sub (三档平均 avg@8) | avg@8 | 33.61 (Short OPD) | 22.58 (Short GRPO) / 15.19 (Instruct) | OPD +18.42 vs Instruct;GRPO 仅 +7.39 且 Mid/Long 几乎不动 |
| 跨环境泛化 (MOPD 单蒸馏 FA 教师到未见 LF 域, Middle avg@8) | avg@8 | 52.58 (After FA) | 34.92 (Instruct) | +17.66,跨域迁移成功 |
| 知识不匹配蒸馏 (Student A + Teacher B, pass@8) | pass@8 | 36.60 (Teacher B 蒸馏) | 44.03 (Instruct) / 46.74 (Teacher A 蒸馏) | -7.43 反而劣化,证明知识 gap 会破坏蒸馏 |
局限与改进
作者坦承的局限:(1) 环境是合成的、技能图用 AND/OR 逻辑与反事实合成规则构造,虽便于可控分析,但与真实互联网语料、真实操作系统/浏览器任务的复杂度有差距,结论能否外推到真实 agent 尚需验证;(2) 模型规模为 1.2B 语料下随机初始化的 Qwen2.5 架构小模型,未在大模型(7B+)上验证三区域与 MOPD 边界是否依旧成立;(3) pass@k 在长程场景会被严重低估(基线近零但 RL 后大涨),作者自己也指出它已不能准确刻画能力上限。我额外观察到:规划模式与规划知识的互信息区分是定性论证($I(T;P) < I(T;K)$),论文并未给出 $I(T;P)$、$I(T;K)$ 的实际数值估计,三区域的边界(horizon 与 quality 维度的具体阈值)也只画了示意曲线而无解析公式;其次所有教师都是同架构、同数据分布训练的「理想教师」,真实场景里教师本身有偏,OPD「教师理想时有效区间大」的前提不一定成立。
独立分析的弱点
弱点一:互信息论证偏定性。作者用 $I(T;P) < I(T;K)$ 推出三区域,却没给出二者在 gym 上的实测估计或可操作阈值。改进方向:用互信息神经估计器在线测 token 级互信息,把「模式/知识」从概念变成可测量,并给出三区域的解析判据。弱点二:教师「理想」假设过强。所有 OPD 优势都建立在教师满分、与学生同分布的前提下;Table 4 已显示教师有偏时会反伤学生。改进方向:在 KL 损失上加置信度加权做选择性蒸馏,并刻画弱教师→强学生的边界。弱点三:环境与真实 agent 脱节。合成 gym 状态转移是确定性 AND/OR 规则,缺随机性与多模态观测。改进方向:迁移到 OSWorld/浏览器/代码执行等真实长程基准,做一组「合成结论 vs 真实结论」对照。弱点四:规模未验证。1.2B 小模型的「MOPD 只小幅扰动」「知识蒸不进」等结论在大模型上是否被打破尚属未知,需补 7B/14B 实验。
未来方向
作者明确点出的方向包括:把可控环境扩展到真实多模态长程任务、研究弱到强/强到弱蒸馏在长程规划下的机理、设计能克服 pass@k 失真的新评估指标。基于本文成果可延伸的方向:其一,把互信息框架做成可计算的诊断工具,在线监测训练中「当前主要在塑模式还是蒸知识」,从而自动在 GRPO/OPD/SFT 间切换;其二,针对知识 gap 导致的蒸馏崩溃(Table 4),设计「教师-学生知识对齐检测」前置关卡,避免无效甚至有害的蒸馏;其三,把 MOPD 的 mode-seeking 特性与 mixture-of-experts、参数高效合并(如 LoRA 级联)结合,探索既能跨环境泛化又避免冲突的架构级方案;其四,研究「错误纠正数据」的配比——作者发现 gold 标准数据不足以教会模型从错误前缀恢复,这对合成 SFT 数据有直接工程价值。
复现评估
复现性较好。作者提供完整开源:代码 (github.com/Quester-one/PlanPhysCode)、模型权重 (HuggingFace MultimodalAgent/TianyiMen_PlanPhys_Models)、数据集 (MultimodalAgent/TianyiMen_PlanPhys_Datasets),以及项目主页。环境是合成的,技能图构建、AND/OR 规则、反事实合成、难度切分都有公式与算法描述(Section 3 + 附录 A.1-A.4)。模型为 Qwen2.5 架构、tokenizer 自训、语料 1.2B、训练 9000 步、单 checkpoint 最多 11520 次推理,算力对小团队友好。难点在于:合成环境与真实任务的对齐验证需额外工程;三区域精确边界与 KL/PCA 机理分析需自行复刻可视化管线;教师模型需按 Recipe A/B、Form a/b/c/d 多配置分别训练,配置管理较繁琐。总体属「读懂即可照搭、但完整复现全部消融需数周」水平。
论文图表
总览图,把全文压缩成一页:预训练(世界模型内化、组合泛化、次优轨迹)、GRPO/OPD 后训练(三区域 + 梯度方向)、MOPD 多教师整合(模式兼容/冲突)三大阶段的核心结论与代表性数字一目了然。
这是理解全文骨架的最佳入口,先看这张图就能把握「获取—塑造—整合」三阶段的研究脉络与关键数字。
PCA 空间里教师离 Instruct 很远、而 MOPD 三阶段都贴在 Instruct 附近;参数 L2 距离 Instruct-MOPD1 仅 0.482,到教师约 71;余弦相似度显示各阶段更新方向各不相同。
从参数动力学解释「MOPD 为何既跨域泛化又只做小幅扰动」「为何蒸不进大规模知识」,机理层面的点睛之笔。