内松弛,跨平衡:面向视觉语言混合专家模型的几何引导负载均衡 Relax Within, Balance Across: Geometry-Guided Load Balancing for Vision-Language Mixture-of-Experts
ReBA通过分离图文负载、每张图作为等权路由实例,解决VLMoE在不同token比例下的负载失衡。
前置知识
Mixture-of-Experts (MoE)
MoE 层把一个稠密 FFN 替换成 $N$ 个并行的专家网络 $\{E_i\}_{i=1}^{N}$,每个 token 只激活其中 top-$k$ 个专家(如 $N=4, k=2$)。一个路由器根据 token 的隐藏状态 $x_t$ 输出 logits $W_r x_t$,再选最大的 $k$ 个专家执行。优点是参数量大但计算量稀疏。
本文所有讨论都建立在 MoE 层的稀疏路由之上,理解 top-$k$ 路由和专家并行才能看懂为什么负载必须均衡。
Switch 辅助损失 (Std-Aux)
Switch Transformer 提出的标准负载均衡损失 $\mathcal{L}_{aux}=N\sum_i f_i p_i$,其中 $f_i$ 是落到专家 $i$ 的硬派送频率,$p_i$ 是平均软门控质量。它惩罚那些硬负载和软概率同时很高的专家,强制负载趋于均匀 $u=(1/N,\dots,1/N)$。$f$ 和 $p$ 都是对全部 token 的平均,不含样本或模态标签。
Std-Aux 正是本文要批判和替换的基线,理解它只约束『混合负载』是理解 ReBA 动机的关键。
专家并行与负载不均
在专家并行部署中,每一层把不同专家分到不同 GPU,每层耗时由最忙的那个专家决定(短板效应)。如果某个专家分到远多于平均的 token,其他专家就会空等,稀疏计算的速度优势被抵消。负载均衡程度用变异系数 $CV(q)=\sqrt{N}\|q-u\|_2$ 衡量,越低越好。
本文的最终价值就是降低专家并行下的瓶颈计算量,理解这一动机才能看懂为什么要追求低 CV。
视觉语言模型的动态分辨率
Qwen2-VL 等现代 VLM 会根据输入图片尺寸动态切分视觉 token,再叠加多图、tiling(分块)、可变 prompt 长度,导致一个 batch 里图像 token 与文本 token 的比例 $a$(图像 token 占比)在很大范围内波动,从约 0.5 到 0.9 都可能出现。
正是这种 token 比例的剧烈波动暴露了 Std-Aux 的缺陷——它只在某一个混合比例下平衡,比例一变就失衡。
Dense-to-Sparse 切分 (Split)
把训练好的稠密 SwiGLU FFN(权重 $W_{gate}, W_{up} \in \mathbb{R}^{I\times H}, W_{down}\in\mathbb{R}^{H\times I}$)按中间神经元做不相交划分 $\{G_e\}$,每个专家只持有自己那部分神经元 $W_{gate}^{(e)}=W_{gate}[G_e,:]$ 等,所有专家拼起来等于原稠密 FFN,参数预算不变,只额外加一个 $N\times H$ 的零初始化路由器。
本文四个实验骨架(Split-Qwen3VL-4B 等)都用这种切分方式构造,理解它才知道实验是怎么搭起来的。
研究动机
视觉语言 MoE 推理时,batch 内的图像/文本 token 比例 $a$ 因为动态分辨率、图片数量、tiling、prompt 长度而剧烈变化。但标准的 token 级 Switch 辅助损失 $\mathcal{L}_{aux}=N\sum_i f_i p_i$ 把所有 token 先平均成一个混合负载再均衡,它根本看不见图像和文本各自的条件负载。后果很严重:在主模型 Split-Qwen3VL-4B 上,同一个已经训练好的路由器,在 5 档分辨率下 RMS-CV 变化超过 5 倍。更隐蔽的是『模态互补抵消』——图像负载误差和文本负载误差方向相反、量级都很大(逐层 Pearson 相关 $-0.949$,平均 $\ell_1$ 间距 $G_1=0.798$),二者在某一个 token 比例下恰好抵消,让混合 CV 看起来只有 0.273 好像很健康。一旦 token 比例漂移,两个误差被重新加权,抵消被打破,混合负载立刻飙升。也就是说,一个收敛的辅助损失根本不保证跨 token 比例的均衡。
本文的目标是本文要让负载均衡在『变化的 token 比例』范围内成立,而不是只在一个点成立。具体目标有三条:第一,缩小图像-文本条件负载间距,让固定条件下的负载曲线 $R(a)$ 变平、低负载区间变宽;第二,在每一个报告的 benchmark 输入和全部四个切分骨架上降低平均逐层 CV,并把最高分辨率/最多 tile 数下的物理最差负载降下来;第三,在达成以上两点的同时,把平均任务精度保持在和 Std-Aux 相当的水平(论文明确只声称 comparable,不声称提升)。方法层面还要求不引入新的路由器或专家参数、额外计算开销可控(每层 $O(|M|N)$)。
与已有工作不同的是,已有 MoE 负载均衡工作(Switch、ST-MoE、BASE、StableMoE、Auxiliary-Loss-Free 等)一律把 token 当成一个混合总体、优化单一混合目标;视觉语言 MoE 路由的工作里 SMAR 观察到模态偏好会涌现,但没有把它和『token 比例敏感性』联系起来。本文的独特切入有三点:其一,推导出一条精确的 composition-shift 律 $R(a)=R(a^\star)+\kappa(a-a^\star)^2/N$,把『最佳负载底』和『对比例的敏感度』彻底分开,数学上锁定条件负载间距 $\kappa=\frac{N}{L}\sum_l\|q_l^I-q_l^T\|_2^2$ 才是控制敏感度的旋钮;其二,去实测路由器输入的几何结构,发现『模态边界』和『图像边界』两个自然尺度;其三,直接用这两个测量到的边界去重设计辅助损失的归一化单元,而不是凭启发式拍脑袋。
核心方法
直觉层面:Std-Aux 之所以失败,是因为它把图像和文本 token 混在一起算一个负载,于是两个模态各自的不均衡能互相抵消。ReBA(Relax Within, Balance Across)干脆把它们拆开——『跨模态分别均衡』。再进一步,同一张图的视觉 token 高度相关(一起被路由),所以应当先在每张图内部把路由统计平均掉(『图内松弛』),再把每张图当作一个等权实例去参与跨图均衡。技术路线是一条『测量驱动设计』的链路:先探测路由器输入几何 → 发现模态/图像两个边界 → 用精确律确认要缩小的量是条件负载间距 → 按边界设计目标函数 → 仍沿用 Switch 的硬-软代理形式,只改路由统计的归一化单元。
核心创新是两个由几何测量直接导出的设计选择,二者正交且缺一不可。第一是分离模态项:$\mathcal{L}_{ReBA}=\lambda_I\mathcal{L}_{img}(\mathcal{M}_I)+\lambda_T\mathcal{L}_{text}(\mathcal{M}_T)$,每一项都是非负的,所以一个模态无法再藏起另一个模态的误差,小损失要求两个模态各自逼近均衡。第二是图像级等权路由实例:每张图的所有视觉 token 组成一个路由实例 $m$,先算实例内平均软轮廓 $P_{m,i}=\frac{1}{S_m}\sum_{t\in m}p_{t,i}$ 和硬轮廓 $F_{m,i}$,再对实例做等权平均 $\bar{F}_r=\frac{1}{|M_r|}\sum_m F_m$,与 token 数量无关。这样长图不会因为 patch 多而拿到额外优化权重。文本保持池化,因为文本的跨样本间距大约是图像的两倍。与已有方法的本质区别是:以往工作改的是路由稳定性/分配策略/全局负载目标,ReBA 改的是『训练期间的条件路由轮廓』,并且这个改变是由实测输入几何决定的,而非启发式。
方法步骤详情
完整步骤如下。输入:每个 token 的路由器输出、图像实例集合 $\mathcal{M}_I$、池化文本实例 $\mathcal{M}_T$、观察到的图像/文本 token 占比 $\lambda_I,\lambda_T$。第 1 步,从稠密 FFN 做不相交切分构造 Split-MoE,加零初始化路由器。第 2 步,对 batch 里每个 token 算软概率 $p_{t,i}=\text{softmax}(g(x_t))_i$ 和归一化硬 top-$k$ 指示 $f_{t,i}=k^{-1}\mathbf{1}[i\in\text{top-}k(g(x_t))]$。第 3 步,按图像身份把视觉 token 切成每张图一个实例,文本全部合成一个池化实例。第 4 步,对每个实例 $m$(含 $S_m$ 个 token)算实例内平均软轮廓 $P_m$ 与硬轮廓 $F_m$。第 5 步,对模态 $r\in\{I,T\}$ 做等实例平均得到 $\bar{P}_r,\bar{F}_r$。第 6 步,用 Switch 形式的实例均衡损失 $\mathcal{L}_{inst}=N\sum_i\bar{F}_i\bar{P}_i$(硬计数 stop-gradient),再按模态加权 $\mathcal{L}_{ReBA}=\lambda_I\mathcal{L}_I+\lambda_T\mathcal{L}_T$。第 7 步,在 Cambrian-737K 上 SFT 一个 epoch,仅改辅助损失,其余训练设置和基线完全一致。
技术新颖性
新颖性体现在理论和实现两条线。理论新颖性:精确律 $R(a)=R(a^\star)+\kappa(a-a^\star)^2/N$ 把『最佳负载底 $R(a^\star)$』和『对 token 比例的敏感度 $\kappa$』彻底分离,并证明 $\kappa=\frac{N}{L}\sum_l\|q_l^I-q_l^T\|_2^2$,从而把抽象的『跨比例稳定性』转化为一个可优化的具体量——条件负载间距。还给出期望负载分解 $E[R(A)]=R(a^\star)+\kappa\,\text{Var}(A)+\kappa(E[A]-a^\star)^2$,三个误差源一目了然。设计新颖性:不靠启发式,而是先测几何(模态区分度 $\gg$ 图间区分度 $>$ 图内区分度),再用测量结果决定均衡单元——模态边界→分项,图像边界→每图一实例。实现新颖性:不新增任何路由器/专家参数,完全复用标准 Switch 硬-软项,只改 token 被平均进哪个组,每层仅多 $O(|M|N)$。消融(Table 3)进一步证明两个选择正交且都必要:只用图像实例(Coupled-ImgInst)无法消除跨模态抵消;只分项(Decoupled-Matched)留下 0.154 的残余 CV,而完整 ReBA 到 0.077。
实验结果
结果系统支持三条主张。其一,ReBA 在每一个 benchmark 和每一个骨架上都降低平均逐层 CV。主模型 Split-Qwen3VL-4B 上平均 CV 从 No-Aux 的 0.69、Std-Aux 的 0.43 降到 ReBA 的 0.16;另外三个骨架(Split-Qwen2.5VL-3B / Split-Qwen2VL-7B / Split-InternVL3-8B)则从 0.26/0.21/0.20 降到 0.19/0.16/0.15。对应平均精度差为 $+0.3,+0.2,-0.2,+0.6$ 个百分点,作者据此只声称『可比』而非『提升』。其二,ReBA 同时改善两个条件负载:逐层 Pearson 相关从 $-0.949$ 升到 $-0.166$,$\ell_1$ 间距 $G_1$ 从 0.798 降到 0.137,证明混合 CV 下降不是靠新的模态抵消。图像均衡通过两条路实现:图内 CV 从 0.48 降到 0.21,图间轮廓占比 $\rho^2$ 从 0.19 升到 0.79,文本 $\rho^2$ 也从 0.30 升到 0.87。其三,跨比例稳定性:固定条件曲率 $\kappa$ 下降 96.3%;在最高分辨率下物理 RMS-CV 从 Std-Aux 的 0.351、Coupled-ImgInst 的 0.139 降到 ReBA 的 0.115;InternVL tiling 实验中 ReBA 在每个 tile 数下都低于 Std-Aux。消融中完整 ReBA 整体 CV 0.077 远低于 Std-Aux 0.273。理想化专家计算代理在 Qwen 中高分辨率档给出 $1.23\sim1.25\times$ 的瓶颈 token 工作量加速。最后,在两个原生稀疏模型 Qwen3-VL-MoE-30B、Qwen3.5-MoE-35B 上做诊断(不训练 ReBA):分别有 52%、61% 的专家从某一模态拿到超过 2 倍派送,且观察到的负载是有限计数零分布均值的 23–28 倍,说明这一现象不是采样噪声而是真实路由结构;同时原生实验显示条件轮廓漂移有时会盖过 token 比例效应(35B 高分辨率下物理曲线甚至反向)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 视觉语言多任务平均精度 (Split-Qwen3VL-4B, 7 个 benchmark 均值) | 平均准确率 (%) | 66.1 | 65.8 (Std-Aux) | +0.3 个百分点,精度可比 |
| Benchmark 输入平均逐层 CV (Split-Qwen3VL-4B) | Mean layer CV (↓) | 0.16 | 0.43 (Std-Aux) | 下降 0.27,约 63% 相对降幅 |
| Benchmark 输入平均逐层 CV (Split-Qwen2.5VL-3B) | Mean layer CV (↓) | 0.19 | 0.26 (Std-Aux) | 下降 0.07 |
| Benchmark 输入平均逐层 CV (Split-Qwen2VL-7B) | Mean layer CV (↓) | 0.16 | 0.21 (Std-Aux) | 下降 0.05 |
| Benchmark 输入平均逐层 CV (Split-InternVL3-8B) | Mean layer CV (↓) | 0.15 | 0.20 (Std-Aux) | 下降 0.05 |
| 图像-文本条件负载间距 (固定探针, Split-Qwen3VL-4B) | 平均 $\ell_1$ 间距 $G_1$ (↓) | 0.137 | 0.798 (Std-Aux) | 下降约 83% |
| 固定条件曲线曲率 (Split-Qwen3VL-4B) | 曲率 $\kappa$ (↓) | 0.0306 | 0.8205 (Std-Aux) | 相对下降 96.3% |
| 最高分辨率物理 RMS-CV (Split-Qwen3VL-4B, 466 配对请求) | RMS-CV (↓) | 0.115 | 0.351 (Std-Aux) | 下降 0.236 |
| 理想化专家计算代理 (Split-Qwen3VL-4B, 中高分辨率) | 瓶颈工作量比 $S_{ideal}$ | 1.23–1.25× | 1.0× (Std-Aux 基准) | ReBA 瓶颈 token 工作量更低 |
局限与改进
作者明确承认若干局限。首先,理想化专家计算代理给出的 $1.23\sim1.25\times$ 不是实测延迟,它假设每专家一台等速设备、完美放置、无通信/内核/shared-expert/非 MoE 层开销,因此只能解读为『潜在』瓶颈收益。其次,固定条件律只隔离 token 比例效应,物理预处理还会改变条件轮廓本身——附录 E.6 显示 Qwen3.5-MoE-35B 在高分辨率下物理曲线相对预测反向(残差 $-0.203$),说明该律预测的是『成分效应』而非完整物理行为。再者,原生 MoE 结果只是诊断、并未在原生稀疏骨架上训练 ReBA。精度提升也是混合的:部分任务下滑(如 Split-Qwen3VL-4B 上 ScienceQA 从 64.4 降到 62.3,HallusionBench 从 65.2 降到 63.1),所以只敢声称 comparable。我的补充观察:实验只覆盖 dense-to-sparse 切分(不相交划分),未覆盖 sparse upcycling 或从零训练;控制域 AUC 与物理 AUC 域不同、不可直接比较;500 样本固定探针是训练语料采样而非留出测试集;最大骨架仅 8B,规模外推存疑。
独立分析的弱点
第一,训练验证只覆盖切分 MoE,原生稀疏骨架(如 Qwen3-VL-MoE-30B)上 ReBA 的训练效果仍是空白——改进方向是直接在原生 128/256 专家模型上跑 ReBA SFT,验证 $\rho^2$ 与图内 CV 的收益是否迁移。第二,图像边界是在 Qwen/Cambrian 上测量的,其他 VLM 架构或视频密集负载的几何尺度可能不同(视频还有时间维度聚类)——改进方向是按架构重新测量路由几何,必要时引入『每视频段一个实例』。第三,每张图等权假设所有图计算代价相同,但多图文档里不同图重要性差异巨大——改进方向是按语义角色对图实例加权。第四,文本保持池化依赖『文本跨样本间距约为图像 2 倍』这一经验结论,长上下文/代码场景可能不成立——改进方向是探索行级或块级文本实例。第五,$\lambda_I,\lambda_T$ 取自训练时观察比例、固定不可调,部署分布漂移时会失配——改进方向是让权重随 workload 自适应或可学习。第六,计算代理与真实延迟之间有鸿沟——改进方向是在真实专家并行硬件上测端到端延迟,把通信/放置/内核开销纳入。每个弱点我都给出了对应改进方向。
未来方向
作者明确点出的方向:在原生稀疏 MoE 上训练 ReBA,并把方法推广到切分模型以外。基于本成果可延伸的方向:其一,把 ReBA 与 auxiliary-loss-free 均衡(Wang 2024a)结合,去 aux-loss 仍保持模态分解;其二,把每图实例思路推广到视频 MoE,用『时间分组』作为额外边界;其三,与容量感知推理(He 2026, Capacity-Aware Inference)联动,训练期 ReBA + 推理期容量调度,进一步压短板效应;其四,理论上把 composition-shift 律从 2 模态推广到 $K$ 模态(音/视/文),推导多模态间距与敏感度的关系;其五,研究推理时动态实例构造(按 batch 实际图像构成即时调整 $\lambda$);其六,刻画『专家特化 vs 均衡』的权衡,因为强行压低图内 CV 可能损害模态特化带来的精度收益(原生诊断里 52%/61% 专家已有强模态偏好)。这些方向既能补齐当前实验缺口,也能把几何引导均衡拓展成更通用的多模态 MoE 训练范式。
复现评估
复现门槛中等偏友好。代码已开源:github.com/ZiangWu-77/ReBA。数据全部开放:训练用 Cambrian-737K,评测用 VLMEvalKit(规则/精确匹配打分,不用 GPT 评判)。骨架均开放:Qwen3-VL-4B-Instruct、Qwen2.5-VL-3B、Qwen2VL-7B、InternVL3-8B。训练设置写得非常细:单 epoch SFT、学习率 $10^{-5}$、cosine 调度、warmup 0.03、序列长 4096、单卡 batch 4×16 累积即全局 512、bf16、FlashAttention、ZeRO-1 + 梯度检查点,全部在 NVIDIA H20 上跑。切分构造(不相交神经元划分、SCALE=$\sqrt{N/k}$、零初始化路由器)在附录 A.2 给出完整张量操作,并附 Algorithm S1 伪代码与符号表。还有 7 点系数扫描、离线 checkpoint 评测、1000 次 paired bootstrap 置信区间、固定 500 样本种子 42 探针。主测试床 4B 在少量 H20 上即可复现;7B 骨架需多卡。唯一略麻烦的是原生 MoE 诊断需自行从 Qwen3-VL-MoE-30B / Qwen3.5-MoE-35B 抓取真实 top-8 派送,附录 E.1 给了协议。整体属于高复现度论文。
论文图表
横轴为图像 token 占比 $a$(0.2–0.8),纵轴为聚合 RMS-CV。三条曲线分别是 Std-Aux、Coupled-ImgInst、ReBA 的固定条件预测,大标记点是 5 档像素预算下的物理运行。Std-Aux 曲线陡峭、低负载区间极窄;ReBA 曲线几乎水平、低位贯穿整个比例范围;物理运行保住了方法排序。
这张图是整篇论文的『动机+核心证据』合一:它直观展示了同一个训练好的 Std-Aux 路由器跨分辨率 RMS-CV 变化超过 5 倍,而 ReBA 把曲线压平,直接证明了跨比例均衡的必要性。