← 返回 2026-08-03

基于采样的博弈论规划:面向实时多车自动驾驶赛车 SGTP: Sampling-based Game-Theoretic Planning for Real-Time Multi-Vehicle Autonomous Racing

Zhouheng Li, Fangguo Zhao, Mattia Piccinini, Baha Zarrouki, Yuan Gao, Zitong Shan, Johannes Betz, Chen Lv, Lei Xie 📅 2026-07-28 👍 1 2026-08-08 18:30
GPU并行 博弈论 自动驾驶赛车 运动规划 迭代最优响应 采样规划

实时采样博弈规划框架,在多车赛车中取得95.24%胜率与10Hz实时性

前置知识

博弈论与广义纳什均衡(Generalized Nash Equilibrium Problem)

多车赛车可被建模为一个博弈:每辆车都是一个博弈参与者,各自选择驾驶策略(轨迹),而每辆车的最优策略又依赖于其他车的策略。广义纳什均衡问题(GNEP)是指各参与者的约束相互耦合,没有哪辆车能通过单方面改变策略而获益的状态。本文将多车赛车形式化为 GNEP,并用迭代最优响应(IBR)来逼近均衡解:固定对手策略不变,轮流为每辆车优化自身策略,反复迭代直至收敛。

理解博弈论框架是读懂本文动机的关键,因为 SGTP 的本质就是把 IBR 中每辆车的最优响应子问题替换成 GPU 采样近似,从而避开传统 MPC 求解器的非凸优化瓶颈。

迭代最优响应(Iterative Best Response, IBR)

IBR 是求解博弈均衡的经典迭代算法。每一轮中,对每个参与者 $i$,固定其他参与者 $j \in I_{-i}$ 的策略不变,求解 $i$ 对当前局面的“最优响应”(即最大化自身收益/最小化自身代价的策略)。把所有参与者都更新一遍算作一轮,重复多轮直到策略不再显著变化。难点在于:每一步最优响应子问题本身是一个非凸优化,在紧邻对抗的赛车场景下对初始化极其敏感,难以在实时预算内稳定收敛。

本文的核心贡献正是用 GPU 采样来近似每一步的“单边最优响应”,理解 IBR 才能理解作者把博弈论和采样规划结合起来的切入点,以及为什么传统 IBR-MPC 会慢且不稳定。

模型预测控制与轮廓控制(MPC / MPCC)

MPC 在每个时刻求解一个有限时域 $H$ 的最优控制问题:基于动力学模型 $x_{i,t+1} = f(x_{i,t}, u_{i,t})$ 预测未来轨迹,最小化代价并施加约束,只执行第一拍控制,下一时刻滚动重解。MPCC(模型预测轮廓控制)是 MPC 在赛车中的特化版本,显式建模赛道进度和参考速度。其优点是能显式处理动力学和安全约束,但在近距离对抗中优化问题高度非凸,求解质量和耗时严重依赖初始化,且常用内点法(如 IPOPT)难以保证实时性。

MPC/MPCC 是本文最重要的对比基线(EVO-MPCC、IBR-MPC),理解它的非凸性和初始化敏感性,才能明白 SGTP 用采样替代优化、用可行性筛选替代软惩罚的设计动机。

模型预测路径积分控制(MPPI)

MPPI 是一类基于 GPU 并行采样的实时规划方法。它在名义控制序列附近,对每个采样 $k$ 叠加高斯扰动 $\epsilon \sim \mathcal{N}(0, \Sigma_u)$,并行前向 rollout 出 $K$ 条候选轨迹,按路径积分(重要性加权)的代价对采样加权平均,更新名义控制序列。MPPI 的优势是充分利用 GPU 并行性、计算快、易实现,但它通常用软代价惩罚处理避碰,缺乏显式的可行性检查,在轮对轮紧贴对抗中容易产生不可行的机动。

MPPI 是 SGTP 最直接的技术前身。SGTP 可理解为“把 MPPI 的并行采样引入 IBR、用博弈感知代价替代路径积分加权、用显式可行性筛选替代软惩罚”,因此理解 MPPI 才能看清 SGTP 的技术谱系和本质区别。

Frenet 坐标系与赛车线(Raceline)

Frenet 坐标系沿一条参考曲线(通常是赛道中线或最优赛车线)定义车辆位置:纵向进度 $s_{i,t}$ 表示沿曲线走了多远,横向偏移 $d_{i,t}$ 表示偏离曲线多远。赛车线 $G$ 是最小曲率参考轨迹,给出参考状态 $x_r(s)$、左右赛道宽度 $w_L(s), w_R(s)$。这种坐标系天然适合赛车,因为“超车=纵向进度领先”“封堵=横向对齐”,比笛卡尔坐标更直观地刻画竞争关系。

本文全部的博弈感知代价(竞赛、纵向优势、封堵、安全)都建立在 Frenet 进度差 $\Delta s_{ij}$ 和横向差 $\Delta d_{ij}$ 之上,理解 Frenet 坐标和赛车线才能看懂代价函数的物理含义。

研究动机

自动驾驶多车赛车要求规划器在激烈交互中实时产生多样的竞争行为——包括跟车、轮对轮缠斗、防守封堵和 opportunistic 超车,并能在这些策略间可靠切换。但现有四类方法各有硬伤。规则化有限状态机(FSM)如 Race Stack 依赖专家手工设计的行为模式与大量调参;基于 MPC/MPCC 的优化方法在近距离对抗中优化问题高度非凸,求解质量和耗时严重依赖初始化,EVO-MPCC 和 IBR-MPC 的平均计算时间分别高达 0.860s 和 1.903s,标准差达 0.646s 和 1.043s,根本无法稳定地满足实时性;纯采样方法(MPPI/Biased-MPPI)虽快但只能处理软代价避碰,在紧贴对抗中产生不可行机动,胜率仅 4.76% 和 2.38%;学习方法(End2Race、CFM)泛化和可解释性不足,CFM 胜率仅 38.10%。更关键的是,把 MPPI 的并行采样与 IBR 博弈框架、定制化博弈代价结合起来这一思路此前从未被探索过。

本文的目标是本文的目标是构建一个能在激烈多车对抗中实时(10Hz)运行的规划框架 SGTP,它既能利用博弈论显式建模交互、产生多样的竞争行为,又能通过 GPU 并行采样获得稳定低延迟的计算性能。具体目标包括:把 IBR 中每一辆车的最优响应子问题重构成 GPU 并行控制采样加动力学 rollout;设计一种博弈感知代价来刻画竞赛状态、纵向优势、封堵对齐和安全余量以驱动多样行为;引入显式可行性筛选(赛道边界 + 碰撞)以保证行为切换的安全可靠;最终在真实算力预算下达到高胜率、高完赛率、长时持续对抗和强可扩展性,并发布开源基准与评测平台供后续研究复用。

与已有工作不同的是,本文的独特切入角度在于“用采样去近似博弈论中的单边最优响应,而非去解非凸优化”。不同于 IBR-MPC 依赖 CasADi/IPOPT 求解每个最优响应、因而慢且初始化敏感,SGTP 用大量 GPU 并行 rollout 直接“枚举”候选策略、用代价排序 + 可行性筛选选出近似最优响应。不同于纯 MPPI 用路径积分加权平均更新控制、并用软代价处理避碰,SGTP 在 IBR 迭代框架内、用博弈感知代价显式鼓励竞争交互、并用硬约束可行性筛选拒绝不可行轨迹。这一组合此前是空白,正是本文填补的缝隙,使得“博弈论的交互丰富性”和“采样规划的计算效率”第一次同时实现。

核心方法

SGTP 的整体思路是“直觉先行、技术随后”。直觉上:与其在近距离缠斗中去解一个对初始化极度敏感的非凸 MPC,不如让 GPU 一次性并行 rollout 出 128 条候选轨迹,用一套能感知“谁在和我竞争、在缠斗还是被压制”的代价把它们排序,再硬性剔除那些撞墙或撞车的候选,剩下的最优就是本轮对对手的近似最优响应;把所有车都这样更新一轮、迭代两轮,就逼近了博弈均衡。技术上,状态为 $x_{i,t}=[x,y,\psi,v]^\top$、控制 $u_{i,t}=[a,\delta]^\top$,动力学用运动学自行车模型 $x_{i,t+1}=f(x_{i,t},u_{i,t})$。赛车线 $G$ 提供 Frenet 参考与边界。整个框架以 10Hz 运行,平均计算时间仅 0.095s,并通过额外的自车响应步和 warm-start 保证连续性。

核心创新点是“把博弈论中的单边最优响应重构成 GPU 采样的轨迹排名 + 可行性筛选”,这与已有方法有本质区别。其一,相对于 IBR-MPC:不再解非凸优化,而是采样 $K=128$ 条候选、并行 rollout、按代价排名,于是计算时间从秒级降到 0.095s 且方差极小。其二,相对于 MPPI:不再用路径积分重要性加权去“平均”所有采样(这会模糊掉多样的竞争策略),而是直接选最低代价的那条可行轨迹,从而能保留封堵、缠斗、超车等差异化行为。其三,相对于软代价避碰:用显式的赛道边界阈值 $m_{bd}=0.515$m 和碰撞阈值 $d_{col}=0.9$m 做硬筛选,确保行为间切换安全可靠。其四,引入博弈感知代价 $c_{\text{game},ij}=c_{\text{contest}}+c_{\text{long}}+c_{\text{block}}+c_{\text{safety}}$,让采样排名具备真正的“竞争意识”。

方法步骤详情

SGTP 完整步骤如下(Algorithm 1)。输入:所有车状态 $\{x_{i,t}\}$、赛车线 $G$、时域 $H=12$、采样数 $K=128$、IBR 迭代数 $L_{\text{IBR}}=2$、自车索引 $e$。第 1 步用基于距离的无碰撞规划初始化所有车轨迹,控制 warm-start 初值置零。第 2 步外层 IBR 循环 $\ell=1,\ldots,L_{\text{IBR}}$:对每辆车 $i$,先固定对手预测 $\hat{\Xi}_{-i}^{\ell}$ 为上一轮解;在名义控制 $U_i^\ell$ 上叠加高斯扰动 $\epsilon_{i,t+\tau}^{(k,\ell)}\sim\mathcal{N}(0,\Sigma_u)$,$\Sigma_u=\text{diag}(\sigma_a^2,\sigma_\delta^2)$($\sigma_a=0.335$、$\sigma_\delta=0.025$),投影到可行控制集后并行 rollout 出 $K=128$ 条候选。第 3 步代价评估:计算名义跟踪控制代价 $c_{\text{track}}^{(k)}$ 与博弈感知代价 $c_{\text{game}}^{(k)}$,总代价 $c_i^{(k)}=c_{\text{track}}^{(k)}+w_{\text{game}}c_{\text{game}}^{(k)}$($w_{\text{game}}=60$)。第 4 步可行性筛选:边界指标 $b_i^{(k)}=\mathbb{I}[\rho_{bd}\geq m_{bd}]$($m_{bd}=0.515$m)、碰撞指标 $o_i^{(k)}=\mathbb{I}[\rho_{obs}\geq d_{col}]$($d_{col}=0.9$m),可行指示 $h_i^{(k)}=b_i^{(k)}o_i^{(k)}$。第 5 步选择 $k_i^{\star,\ell}=\arg\min_{k:h_i^{(k)}=1}c_i^{(k)}$,若无候选可行则退化为选总违反 $\nu_i^{(k)}$ 最小者。第 6 步用选中轨迹 warm-start 下一轮。第 7 步迭代结束后自车再做一次额外最优响应,输出所有车规划轨迹。

技术新颖性

技术新颖性体现在四个相互支撑的设计上。其一,首次把 IBR 的最优响应子问题重构成“GPU 并行采样 + rollout + 代价排名”,绕开非凸 MPC 求解,使博弈论规划在 0.095s 内稳定完成多步迭代,而 IBR-MPC 需 1.903s。其二,提出博弈感知代价,用四个互补项塑造交互:竞赛项 $c_{\text{contest}}=-w_{\text{contest}}\mathbb{I}_{ij}^{(k)}$ 把 rollout 拉回有意义的竞争窗口;纵向优势项 $c_{\text{long}}=-w_{\text{long}}\alpha_{ij,t}\Delta s_{ij,t+H}^{(k)}$ 鼓励超越,自适应权重 $\alpha_{ij,t}=(1+|\Delta s_{ij,t}|(s_{\text{contest}}+\epsilon)^{-1})^{-1}$ 在两车靠近时加大奖励;封堵项 $c_{\text{block}}=-\gamma_{\text{block},ij}(1+\Delta d_{ij,\text{tail}}^{(k)})^{-1}$ 鼓励横向对齐压制后车;安全项 $c_{\text{safety}}=w_{\text{safety}}[\max(0,g_{\text{safe}}-g_{\min,ij}^{(k)})]^2$ 二次惩罚间距不足。其三,用硬约束可行性筛选替代 MPPI 的软代价避碰,从机制上杜绝不可行近距机动。其四,自车额外的最优响应步把计算预算更倾斜地花在自车上,兼顾公平博弈与自车性能。

Proposed SGTP framework for multi-behavior autonomous racing
Fig. 1: Proposed SGTP framework for multi-behavior autonomous racing
Proposed Sampling-Based Game-Theoretic Planning (SGTP) framework
Fig. 2: Proposed Sampling-Based Game-Theoretic Planning (SGTP) framework

实验结果

Table I 的 42 次试验(7 条赛道×6 起点,每场 3 车、最长 50s)给出充分证据。SGTP 取得 95.24% 进度胜率、100% 无碰撞胜率、75.00% 最终超车比、CSD=0.99、平均完赛 $D_{mean}=49.67$s(占最大时长 99.35%)、平均车速 $\bar v_{ego}=5.86$m/s、控制平滑度 MCS=0.008,平均计算时间 $CT_{mean}=0.095$s(标准差仅 0.004s、最大 0.102s),实现稳定 10Hz。对比下,最接近的 EVO-MPCC(92.86% 胜率但 CFW 仅 2.56%、$CT_{mean}=0.860$s)和 IBR-MPC(85.71% 胜率、CFW 5.56%、$CT_{mean}=1.903$s)都既慢又不稳定、无法维持长时对抗;纯采样 MPPI/Biased-MPPI 胜率仅 4.76%/2.38%;学习方法 CFM 胜率 38.10%。消融尤为关键:去博弈代价(SGTP w/o GC)胜率掉到 50%;把博弈代价塞进 MPPI 但去可行性筛选(GA-IBR-MPPI)胜率 57.14%、CFW 0%、$D_{max}$ 仅 5.21s——证明两者缺一不可。Table II 显示防守端把对手 CFW 压到 3.88%;对手预测加 mild 噪声 $D_{mean}$ 仅降 0.52%、CFW 升至 97.14%,severe 噪声 CFW 仍达 94.12%。Fig. 5 显示车数 2→10 时 SGTP 计算时间低且稳定、全程无碰撞,而 IBR-MPC 时间与方差快速上升并发生碰撞。

SGTP enables competitive behaviors and reliable transitions between them in highly interactive scenarios on multiple racetracks
Fig. 3: SGTP enables competitive behaviors and reliable transitions between them in highly interactive scenarios on multiple racetracks
Longitudinal gaps and velocity profiles from t1 to t8 on the Berlin track
Fig. 4: Longitudinal gaps and velocity profiles from t1 to t8 on the Berlin track
Competitive performance & scalability of SGTP
Fig. 5: Competitive performance & scalability of SGTP
查看结构化数据
任务指标本文基线提升
多车自动驾驶赛车(进度胜率 Wins) 进度胜率 Wins(越高越好) 95.24% EVO-MPCC 92.86% / IBR-MPC 85.71% / Race Stack 45.24% / CFM 38.10% / MPPI 4.76% 相对次优 EVO-MPCC 提升约 2.4 个百分点,相对 IBR-MPC 提升约 9.5 个百分点,且唯一同时兼顾高胜率与实时性
多车自动驾驶赛车(无碰撞胜率 CFW) 无碰撞胜率 CFW(越高越好) 100.00% EVO-MPCC 2.56% / IBR-MPC 5.56% / SGTP w/o GC 14.29% / GA-IBR-MPPI 0.00% 从次优的约 14% 跃升至 100%,凸显可行性筛选对安全性的决定性作用,是质的飞跃
实时规划效率 平均计算时间 CTmean(越低越好,单位秒) 0.095s(标准差 0.004s,最大 0.102s) IBR-MPC 1.903s(标准差 1.043s)/ EVO-MPCC 0.860s(标准差 0.646s) 比 IBR-MPC 快约 20 倍、比 EVO-MPCC 快约 9 倍,且方差小两个数量级,实现稳定 10Hz
长时对抗维持 平均完赛时长 Dmean(越高越好,最大 50s) 49.67s(完赛比 99.35%) EVO-MPCC 10.58s / IBR-MPC 12.46s / GA-IBR-MPPI 2.22s(Dmax 5.21s) 约为次优 IBR-MPC 的 4 倍,能在激烈交互中持续近整个允许时长而不碰撞
超车能力 最终超车比 FPR(越高越好) 75.00% EVO-MPCC 8.33% / IBR-MPC 10.71% / SGTP w/o GC 28.57% 相对次优的消融版本(28.57%)提升约 2.6 倍,相对最强基线(10.71%)提升约 7 倍

局限与改进

作者承认的局限主要有两点:博弈感知代价的权重 $[w_{\text{contest}},w_{\text{long}},w_{\text{block}},w_{\text{safety}}]=[1.0,2.0,10.0,50.0]$ 是手工调参得到的,泛化到差异较大的赛道或车型时可能需要重新整定;其次依赖固定的对手预测,未引入基于世界模型的对手风格识别,难以应对风格迥异的真实对手。从我自己的观察补充几点:评测全部基于 F1TENTH Gym 仿真与运动学自行车模型,缺少与真实物理(轮胎滑移、空气动力学)的衔接,sim-to-real 风险未被讨论;FPR、CSD 等关键指标的对手多为同款 SGTP 或 MPPI,缺少对真正异构强对手(如学习型激进策略)的压力测试;mild 噪声下 CSD 已下降 55.88%,说明近距离交互强度对预测质量相当敏感;此外 $L_{\text{IBR}}=2$ 的浅迭代是否能逼近复杂局面下的均衡、以及在超 10 车时的渐近行为也需更系统的论证。

独立分析的弱点

第一,代价权重需手工整定。当赛道几何、车辆动力学或对抗强度变化时,$s_{\text{contest}}=8.0$m、$w_{\text{block}}=10.0$ 等参数未必最优。改进方向:用元学习或贝叶斯优化在线自适应这些权重,或把权重作为可学习参数端到端训练。第二,对手建模过于简化——固定预测、对手多为同款规划器。改进方向:引入对手意图/风格识别与可微世界模型预测,使博弈代价能条件化于“对手类型”。第三,仿真保真度有限,仅用运动学自行车模型。改进方向:接入动力学模型与轮胎模型,并在真车 F1TENTH 平台做闭环验证,评估 sim-to-real 迁移。第四,对预测噪声鲁棒性不均——mild 噪声下 CSD 暴跌 55.88%,说明缠斗强度受预测质量拖累。改进方向:在采样或可行性筛选中显式建模预测不确定度(如 chance-constrained 或 min-max 鲁棒化)。第五,$L_{\text{IBR}}=2$ 的浅迭代对高对抗局面可能不足。改进方向:自适应迭代数或异步 IBR。

未来方向

作者明确提出的方向:减少参数整定负担,并引入基于世界模型的对手风格识别来改善预测。基于本成果可延伸的方向包括:其一,把博弈感知代价与可微 MPC 结合,保留显式约束的优势同时获得梯度信息以加速调参;其二,扩展到非对称博弈(车辆能力异构、不同目标函数如领航车 vs 追赶车);其三,与学习型对手(强化学习策略、生成式轨迹模型如 CFM)做闭环自我博弈,形成更强的对抗训练范式;其四,研究多车协作场景(如车队 drafting/slipstream)下的合作-竞争混合博弈;其五,把 SGTP 的采样排名思想迁移到通用自动驾驶的密集交互(无信号路口、并道),验证其更广泛的适用性;其六,探索在真实硬件上的部署与延迟约束下的算力分配策略。

复现评估

复现性是本文一大亮点。作者已开源代码、基准与评测平台(主页 https://sgtp-racing.github.io/,赛道来自开源 MapZoo 仓库 https://github.com/zhouhengli/MapZoo),以 F1TENTH Gym 与运动学自行车模型为统一仿真底座。关键超参数披露充分:$K=128$、$H=12$(1.2s)、$\sigma_a=0.335$、$\sigma_\delta=0.025$、$Q=[60,60,47.75,39.48]$、$R=[8.43,20.0]$、$S=[1.0,19.26]$、$w_{\text{game}}=60$、$L_{\text{IBR}}=2$、$m_{bd}=0.515$m、$d_{col}=0.9$m 及四个代价权重,足以重建主实验。硬件门槛中等:SGTP、MPPI 与学习方法在单张 NVIDIA GeForce RTX 4060 上运行,MPC 基线用 CasADi+IPOPT。评测协议清晰:7 条赛道×6 起点共 42 次试验、每场 3 车、最长 50s,给出 Wins/CFW/FPR/CSD/$D_{mean}$/MCS/CT 等完整指标。主要不确定性在于学习基线(End2Race、CFM)的对手预测采用 MPPI 以稳定预测,与 SGTP“自对自”设置略有差异,需对照原论文注意细节。总体凭借开源与详尽参数,复现难度较低。