← 返回 2026-09-11

DRG-MAPPO:面向协同空战的分层动态角色图多智能体强化学习 DRG-MAPPO: Hierarchical Dynamic Role-Graph Multi-Agent Reinforcement Learning for Cooperative Air Combat

Junlin Liu, Chengwei Li, Yang Gao, Hui Chang, Xinchen Zhang, Zhijun Zhao, Hao Zhao 📅 2026-09-10 👍 12 2026-09-12 18:30
MAPPO 分层强化学习 图注意力网络 多智能体强化学习 空战决策

图注意力建模战场实体关系并动态分配战术角色,2v2超视距空战胜率达87%

前置知识

Dec-POMDP(分散式部分可观测马尔可夫决策过程)

多智能体序贯决策的标准形式化:元组 $\langle I, S, \{\Omega_i\}, \{A_i\}, T, Z, \{R_i\}, \gamma \rangle$,其中每个智能体只能拿到局部观测 $o_i$ 而看不到全局状态 $s$,转移函数 $T$ 与观测函数 $Z$ 刻画环境动力学,目标是学联合策略最大化每个智能体的期望折扣回报 $\max_\pi \mathbb{E}[\sum_t \gamma^t R_i(s_t, a_t)]$。空战中雷达锁定、导弹威胁等信息天然分散在各机上,正是这种结构。

论文第 3.1 节直接把 2v2 超视距空战建模为 Dec-POMDP,全文的观测空间、奖励函数、折扣因子等符号都建立在该框架上,不懂它就无法理解问题设定与 CTDE 训练方式的由来。

MAPPO 与 CTDE(集中训练、分散执行)

多智能体版 PPO:训练时集中式 critic $V_\psi(s)$ 看全局状态评估价值,参数共享的 actor $\pi_\theta(o_i)$ 只用局部观测执行动作。actor 优化裁剪代理损失 $L_{actor} = -\mathbb{E}[\min(\rho_t \hat{A}_t, \text{clip}(\rho_t, 1-\epsilon, 1+\epsilon)\hat{A}_t)]$,其中 $\rho_t = \pi_\theta/\pi_{\theta_{old}}$ 为概率比;critic 最小化状态值与折扣回报 $\hat{G}_t$ 的 MSE,优势 $\hat{A}_t$ 用 GAE 估计以平衡方差与偏差。

DRG-MAPPO 完全建立在 MAPPO 骨架之上,只是在其中插入图编码器、角色分配头与辅助头。理解 actor/critic 结构、裁剪机制和 GAE,是读懂式 (2)-(4)、(22)-(23) 与联合损失的前提。

图注意力网络(GAT / 缩放点积注意力)

把实体当节点、实体间关系当边,用注意力机制聚合邻居信息:$Q = HW_Q, K = HW_K, V = HW_V$,注意力矩阵 $A = \text{softmax}(QK^\top / \sqrt{d_h})$,输出经残差连接、LayerNorm 与前馈网络(FFN)更新。$A$ 的元素 $A_{jk}$ 表示实体 $j$ 对实体 $k$ 的关注程度,可解释为关系强度。相比图卷积,注意力能动态加权时变关系。

本文用全连接实体图上的缩放点积注意力提取敌机、友机、导弹之间的时变关系特征,产出三级表征 $z_{self}$、$g_{agent}$、$g_{team}$,这是整个“图关系建模”模块的核心计算单元。

分层强化学习(HRL)

把决策拆成两层:高层策略输出抽象子任务、目标或“选项”,低层策略执行具体动作,从而缓解长时序任务的探索困难与信用分配难题。空中协同中的典型分工是高层定战术(谁主攻、谁掩护、谁诱敌),低层做机动控制(转向、爬升、规避)。

本文的本质就是 HRL 在 MARL 中的具体化:把角色分配(高层)与机动执行(低层)解耦。理解分层思想才能明白为何需要 $T_{role}$ 时间承诺机制、为何角色梯度只在重采样步计算并使用独立裁剪系数 $\epsilon_r$。

辅助任务与多任务学习

在主任务损失之外增加一个有监督辅助头,与主策略共享主干编码器,用额外的监督信号塑造中间表征,让编码器学到对主任务有用的特征,往往还能加速探索、稳定训练。典型形式是分类头的交叉熵损失与主损失加权相加。

目标优先级辅助任务是本文诱导“集火”行为的关键设计:辅助头 $p_{aux}$ 与主策略共享图编码器,用启发式打分生成的标签做交叉熵监督,从而不依赖复杂的奖励塑形就能让智能体学会“该优先打谁”。

研究动机

现代空战正从单机格斗转向多无人机集群协同,任务成败取决于侧翼包抄、诱敌换位、协同压制等复杂战术配合。现有协同空战决策系统多依赖专家规则、优化方法或手工设计的战术指标,它们能在熟悉场景下可靠工作,但在导弹、雷达与队友交互共同决定战局的高动态对抗中难以扩展。基于 MARL 的方法虽能处理高维连续状态空间,却存在两大具体缺陷:其一,缺乏结构化关系建模,智能体无法精确感知战场实体间快速变化的拓扑关系(例如敌方突然转移导弹威胁时),从而错过最佳战术窗口;其二,传统扁平架构把战略意图与底层机动混在一起,缺乏显式的战术角色建模,导致任务分配模糊、出现“角色混乱”,无法涌现“长机-僚机诱饵”这类非对称配合。论文交叉对抗实验显示,QMIX、IPPO 等基线的平均胜率仅约 36% 与 25%,说明价值分解与独立学习都不足以支撑紧耦合战术协同。

本文的目标是本文的目标是提出一个将基于图的关系建模与动态角色分配相结合的分层 MARL 框架 DRG-MAPPO:把决策过程解耦为两级——高层角色策略在图注意力提取的结构化战场表征之上,动态为每架无人机分配明确的战术职责(如“长机/僚机”“攻击者/支援者”),消除任务分配歧义;低层策略在角色条件化下执行离散机动动作,实现战术意图与机动控制的联合优化。同时通过目标优先级辅助任务在不做复杂奖励塑形的前提下诱导集火等协作行为,用时间承诺机制保证行为一致性、防止训练中的角色振荡,最终在高保真 2v2 超视距(BVR)空战仿真中显著超越 MAPPO、HAPPO、QMIX、IPPO、MAPPO+GAT 等基线,达到 87% 的峰值胜率,并保持可解释性与优化稳定性。

与已有工作不同的是,现有工作的空档在于:HRL 空战方法虽将战术决策与机动控制解耦,但依赖启发式状态划分或静态任务分配;现有基于图的多智能体框架要么只建模友军通信拓扑,要么采用静态图结构,难以刻画密集敌我交战中全面、时变的拓扑变化。DRG-MAPPO 的独特切入是把“角色”本身作为可学习的高层策略输出而非人工预设:用覆盖 self/ally/enemy/missile 四类实体的全连接动态图捕捉时变关系,再配以两个配套机制——时间承诺(角色仅在固定间隔重采样,防止高频振荡破坏训练稳定)与目标优先级辅助任务(用启发式打分生成监督标签,以交叉熵而非奖励塑形的方式注入“集火”先验)——三者在统一 CTDE 框架下端到端联合训练。这与只加图模块的 MAPPO+GAT、只做分层的 HAPPO 形成方法论上的鲜明对比。

核心方法

直觉上,空战协同的关键是“看清场上关系”加“分工明确”:谁咬住谁、谁的导弹在威胁谁、谁当诱饵、谁绕侧翼。DRG-MAPPO 据此分三步。第一步把每步战场观测建模为实体图 $G_t=(V_t,E_t)$,节点分 self/ally/enemy/missile 四类(特征分别为 10/6/7/5 维),零填充对齐维度并拼接类型嵌入后经两层 MLP 得 $h_k$,再用缩放点积图注意力编码,产出 $z_{self}$、$g_{agent}$、$g_{team}$ 三级表征。第二步高层角色策略基于三级表征与全局上下文为每个智能体输出离散战术角色,经可学习嵌入表 $E_{role}$ 变为向量,且仅在每 $T_{role}$ 步重采样(时间承诺)。第三步低层策略以角色嵌入为条件,从 12 个离散战术指令(转向、爬升、俯冲、加减速、S 形机动、notch 规避、发射导弹)中选择动作,由自动驾驶仪转成航迹。训练沿用 CTDE:集中式 critic 看全局状态 $s$,actor 只用局部观测,联合损失 $L = L_{actor} + \lambda_r L_{role} + \lambda_V L_{critic} + \lambda_{aux} L_{aux} - \sum \lambda_H H(\pi)$ 由 Adam 端到端优化,其中 $\lambda_{aux} L_{aux}$ 来自塑造表征的目标优先级辅助头。

核心创新是把“战术角色”变成显式的、可学习的高层决策变量,并用三个配套机制保证其稳定可训练。其一,动态角色分配:$\pi_{role}(r_i|o_i) = \text{softmax}(\text{MLP}_{role}([z_{self}; g_{agent}; c_{global}]))$,角色不是人工规则而是策略输出;用可学习嵌入 $e_{role} = E_{role}[r_i]$ 替代 one-hot,以表达角色间潜在相似性并给下游更丰富的梯度。其二,时间承诺机制:仅当 $t \bmod T_{role} = 0$ 时重采样角色,否则沿用 $r_i^{t-1}$,强制行为在窗口内一致、让队友可预判彼此意图,同时降低高层决策频率以稳定训练;角色梯度只在重采样步计算并使用独立裁剪系数 $\epsilon_r$。其三,目标优先级辅助任务:辅助头与主策略共享图编码器,用启发式 $\text{score}(i,j) = d_{ij} - \alpha_1 L^{own}_{ij} + \alpha_2 L^{enemy}_{ij} - \alpha_3 M_j$ 生成“该集火谁”的标签并以交叉熵监督。与已有方法的本质区别在闭环:MAPPO+GAT 只加图模块、HAPPO 只做分层,均未把“学习出的动态角色 + 时变全实体图 + 辅助监督”三者协同起来。

方法步骤详情

(1) 观测转图:每步局部观测转为实体图,self 节点 10 维(位置、速度、姿态角、剩余弹量 $n_m$、被探测标志 $\delta_{det}$ 等),ally/enemy/missile 节点分别为 6/7/5 维相对特征(距离、方位、速度差、接近速度、ASE 角、威胁标志等);零填充对齐后拼类型嵌入,经两层 MLP 得 $h_k$。(2) 图注意力编码:$A=\text{softmax}(QK^\top/\sqrt{d_h})$,残差+LayerNorm+FFN 更新,取 $z_{self}=H^{(L)}[0]$、节点均值 $g_{agent}$、全队均值 $g_{team}$。(3) 高层角色分配:由 $z_{self}$、$g_{agent}$ 与全局上下文 $c_{global}$ 经 softmax 输出离散角色,每 $T_{role}$ 步重采样否则保持上一角色。(4) 查可学习角色嵌入 $e_{role}=E_{role}[r_i]$。(5) 低层动作:$\pi_\theta(a_i|o_i,r_i)$ 以 $[f_{obs};z_{self};g_{agent};c_{global};e_{role};id_i]$ 为输入,从 12 个离散指令(保持、±30°/±60° 转向、爬升、俯冲、加减速、S 形机动、notch、发射导弹)中选择,自动驾驶仪转成航迹。(6) 集中式 critic 输入全局状态、图表征与角色嵌入,估计 $V_\psi(s,r_i)$。(7) 辅助头 $p_{aux}$ 输出对 $N_e$ 个敌机的优先级分布,标签由启发式评分(距离、双方锁定状态、已跟踪导弹数)取最低分敌机,交叉熵监督。(8) 奖励 $r=r_{combat}+\alpha r_{adv}+\beta r_{threat}+r_{bound}$,含 ATA 对准项 $(1-\theta_{ATA}/\pi)e^{-d_e/D_{max}}$、导弹威胁罚与越界罚,按式 (26) 联合优化,角色梯度仅在重采样步回传。

技术新颖性

技术新颖性体现在四个层面。第一,角色作为学习目标:以往 HRL 空战的高层输出子目标或空间区域,任务分配靠启发式;本文高层直接输出离散战术角色并配可学习嵌入表,角色语义(长机/僚机、攻击/支援)由训练自动形成,消融实验证明去掉角色分配后性能明显下降。第二,全实体动态图:多数图式 MARL 只建友军通信拓扑或静态图,本文把敌机、来袭导弹一并入图,注意力矩阵 $A$ 显式刻画敌我导弹间的时变关系,配合目标优先级辅助任务把注意力引向战斗关键特征。第三,时间承诺机制:用 $t \bmod T_{role}$ 的硬性重采样间隔解决分层 MARL 中常见的高层高频振荡问题,并配独立裁剪系数 $\epsilon_r$ 只在重采样步回传角色梯度——这是一个针对“角色类分层决策”量身定做的训练技巧。第四,非奖励工程的协作诱导:集火行为不是写进奖励函数,而是通过共享编码器的辅助分类任务(交叉熵)以归纳偏置方式注入,避免奖励过度工程,同时保留涌现“诱饵-侧翼”等复杂战术的空间。

Overview of the DRG-MAPPO framework. (1) graph-based state modeling for entity relationship extraction, (2) a hierarchical RL structure for tactical decision-making, and (3) centralized training and decentralized simulation.
Fig. 2: Overview of the DRG-MAPPO framework. (1) graph-based state modeling for entity relationship extraction, (2) a hierarchical RL structure for tactical decision-making, and (3) centralized training and decentralized simulation.

实验结果

训练对比(Fig. 3):2500 集训练中所有方法在 0-800 集经历相似冷启动瓶颈,约 1250 集后 DRG-MAPPO 显著领先,最终峰值胜率 87%;平均回合奖励从约 -450 起步(频繁越界与导弹损耗),约 400 集转正,DRG-MAPPO 收敛到最高约 950,中游方法停在 500-650。消融(Fig. 4a):去掉图建模、动态角色分配、辅助任务或时间承诺任一模块,胜率都明显下降且波动加剧,四个模块协同起效而非单点贡献。交叉对抗(Fig. 4b):各策略两两对战 200 集,DRG-MAPPO 平均胜率 69.9%,对 IPPO/QMIX/MAPPO/HAPPO/MAPPO+GAT 分别为 0.876/0.812/0.735/0.654/0.608;自战对角线约 0.513,偏离 0.5 来自环境内在随机性。战术可视化(Fig. 5):涌现“诱饵-侧翼”(Supporter 前出引火力、Leader 侧向绕后获得离轴攻击几何)、按优先级从互补角度集火同一目标,以及威胁消失后 Supporter 由守转攻并命中目标等可解释行为,验证了框架在关系建模、可解释性与优化稳定性之间的平衡。

Training curves of DRG-MAPPO and other baselines in the 2v2 scenario.
Fig. 3: Training curves of DRG-MAPPO and other baselines in the 2v2 scenario.
Comprehensive evaluation in the 2v2 scenario. (a) The training win rates of ablation experiments. (b) The heatmap of confrontation experiments.
Fig. 4: Comprehensive evaluation in the 2v2 scenario. (a) The training win rates of ablation experiments. (b) The heatmap of confrontation experiments.
Visualization of emergent tactical behaviors in a 2v2 engagement.
Fig. 5: Visualization of emergent tactical behaviors in a 2v2 engagement.
查看结构化数据
任务指标本文基线提升
2v2 超视距空战训练(2500 集) 峰值胜率 87% MAPPO+GAT / HAPPO(次优梯队,训练曲线明显更低) 约 1250 集后与全部基线拉开显著差距,为所有方法中最高
训练收敛后的平均回合奖励 渐近奖励 约 950 中游方法(MAPPO+GAT、HAPPO)500-650,MAPPO 更低 比中游基线高约 300-450
交叉对抗循环赛(每对 200 集) 平均胜率(对全部对手取均值) 69.9% MAPPO+GAT 约 60.5%、HAPPO 约 54.9%、MAPPO 约 45.4%、QMIX 约 36.1%、IPPO 约 25.4% 比最强基线 MAPPO+GAT 高约 9.4 个百分点,对所有单场对决均胜率超 50%

局限与改进

作者明确承认的局限:实验仅在 2v2 场景验证,框架在更大规模集群对抗中的可扩展性留待未来工作;交叉对抗对角线的 0.513 偏差也说明环境随机性不可忽略。我的补充观察:第一,评估完全基于自研 C++ 仿真器(200km×100km 战场、每机 4 枚空空导弹、3km 高度、180 m/s 初速、800 秒上限、按存活数量判胜负),没有第三方公开基准,跨论文可比性弱;第二,对手池只含 5 个训练出的基线与规则策略,对训练分布外对手的泛化证据有限;第三,关键超参(角色数 $K$、$T_{role}$、$\lambda$ 权重、奖励系数 $\alpha/\beta$、网络维度)正文未给出,妨碍精细复现与消融解读;第四,奖励中的 $r_{adv}$ 仍以天线校角(ATA)和距离塑形,属于人工先验,与“避免奖励过度工程”的叙事存在一定张力;第五,12 个离散动作由自动驾驶仪执行,其底层控制律与真实空气动力学可行性未在文中验证。

独立分析的弱点

第一,角色空间是固定大小的离散集合($K$ 个),粒度需人工设定且论文未可视化角色嵌入的语义聚类,角色到底学出了几种“战术人格”不清楚;改进方向是对 $E_{role}$ 做聚类/投影分析,或引入自适应角色数、连续角色流形。第二,时间承诺用固定 $T_{role}$,节奏无法随战况变化——导弹来袭瞬间与巡航阶段显然需要不同的换角色频率;可改为可学习的终止函数(选项式 HRL)或事件触发(威胁标志 $b_m$ 置位时强制重评估)。第三,辅助任务标签来自启发式评分(距离、锁定状态、已跟踪导弹数),若启发式有偏,表征会被带偏;可用自我博弈统计出的击杀归因或学习型对手模型替代硬标签。第四,集中式 critic 与全连接图在智能体数 $N$ 增大时计算量随节点数上升、角色组合爆炸;可引入稀疏注意力或层次化团队结构(编队级角色 + 机级角色)。第五,缺少通信受限、观测噪声、部分智能体损失等鲁棒性实验,工程落地前必须补齐;第六,未建模禁飞区、误伤、燃料等安全约束,可用约束马尔可夫决策过程加 Lagrangian PPO 扩展。

未来方向

作者提出的方向是探索该分层范式在更大规模集群对抗中的可扩展性。基于本文成果还可延伸:其一,把固定 $T_{role}$ 换成可学习的“何时换角色”策略,让承诺时长随战术节奏自适应;其二,把图注意力矩阵 $A_{jk}$ 本身作为战术关系的可视化与解释工具,实证检验其是否对应雷达锁定、导弹威胁等真实战术关系,提升可解释性;其三,接入更高保真动力学仿真器(如 JSBSim 六自由度模型)和更丰富的武器/传感模型,检验离散战术动作到真实飞控的迁移性;其四,结合对手建模与基于种群的自我博弈,提升对训练分布外策略的泛化;其五,用离线 RL 或人类飞行数据先验缩短 0-800 集的冷启动阶段;其六,把目标优先级辅助任务推广为一般化的“战术知识注入”框架,覆盖编队保持、电子战协同、诱饵投放等更多先验;其七,研究角色机制与通信学习的结合,让队友显式传递角色意图而非仅靠行为隐式协调。

复现评估

复现难度中高。论文未提供开源代码或环境;仿真器为自研 C++(配 GTacview 可视化),战场设置描述较细(200km×100km、双方各 2 机、每机 4 弹、3km 高度、180 m/s、800 秒上限、按存活数量判胜负),但自动驾驶仪控制律、导弹毁伤模型、探测模型($\delta_{det}$ 的判定方式)均未描述。方法侧超参如隐藏维度 $d_h$、角色数 $K$、承诺间隔 $T_{role}$、学习率、各 $\lambda$ 权重、裁剪系数 $\epsilon$ 与 $\epsilon_r$、奖励系数 $\alpha/\beta/R_{win}/R_{lose}/R_{oob}$、距离阈值 $D_{max}/D_{safe}$ 全部缺失。好消息是全部组件(GAT、MAPPO、GAE、辅助头)均有公开实现,且 2v2 规模、低维观测、2500 集的训练量单张消费级 GPU 即可完成;主要成本在自建可信的 BVR 仿真器与导弹交战模型,有 MARL 经验的团队约需数周。结论:算法可复现,但结果数值的可信度取决于自建仿真器的保真度。