← 返回 2026-08-26

MoTE:面向多任务视频理解的混合任务专家 MoTE: Mixture of Task Experts for Multi-Task Video Understanding

Muhammad Asad Ali, Umar Khan, Nadia Robertini, Didier Stricker 📅 2026-08-25 👍 3 2026-08-30 18:30
多任务学习 多模态大模型 模块化架构 混合专家 视频理解

把LLM前馈层改造成任务专家,任务级路由让1B模型超越8B基线且可即插即拔增删任务。

前置知识

稀疏混合专家(Sparse MoE)

稀疏混合专家是条件计算的典型架构:把 Transformer 中的部分子层(通常是 FFN)替换为多个并行专家网络,由可学习门控为每个 token 选出 top-k 个专家参与计算,其余专家闲置。这样存储参数量可远超稠密模型,而每个样本实际激活的计算量保持较小,代表工作有 Switch Transformer、GShard、V-MoE 和 MoE-LLaVA。

本文的 MoTE 正是对这一范式做任务级改造,理解标准 MoE 的 token 级路由机制,才能看清 MoTE 用显式任务索引替代可学习门控到底改变了什么。

FFN 与稠密到稀疏初始化

前馈网络(FFN)是 Transformer 每层中注意力之后的两层 MLP,约占模型三分之二参数,被认为存储了大量事实性与任务性知识。稠密到稀疏初始化(sparse upcycling)指把预训练好的稠密 FFN 整体复制或切分成多个专家作为起点,再继续训练使其分化,避免专家从随机权重开始学起。

MoTE 的做法就是把 LLM 每层 FFN 复制成任务专家加共享专家,论文消融还证明整体复制(62.9%)显著优于按神经元切分(60.3%),理解 FFN 的角色是读懂方法的前提。

LoRA 低秩适配

LoRA 冻结预训练权重,只在旁边注入一对低秩矩阵的乘积来参数化权重更新,训练时只更新这部分极小的参数,推理时可合并回原权重。它让有限算力下微调大模型成为主流做法。

VideoLLM-MoTE 训练时用 LoRA 微调 Llama-3.2-1B 解码器,仅训练 MLP 投影层、LoRA 适配器与被选中的专家,这直接决定实验的算力需求和可复现性。

多任务学习与负迁移

多任务学习让一个模型同时服务多个任务,共享表征通常能带来正迁移;但当任务的目标函数、时间跨度或输出格式差异较大时,共享参数会互相拉扯,出现负迁移,即多任务联合训练反而不如单任务分别训练。指令混合训练同样存在此类任务冲突。

程序性视频理解中动作识别、下一步预测、过程规划共享同一帧序列但输出结构迥异,正是这种任务冲突催生了把任务特化计算放进解码器 FFN 的动机,也解释了 MoTE 为什么有效。

视频指令微调与流式静默损失

视频指令微调把视觉编码器经投影层接入 LLM,用指令-回答数据训练模型按用户提示作答。VideoLLM-online 风格的训练目标除语言建模损失外,还包含流式静默项:在不该说话的帧位置监督模型输出 EOS,使其在连续视频流中知道何时保持沉默、何时开口。

MoTE 沿用了这一双项损失,公式中语言响应指示子与流式静默指示子各自的含义,直接关系到对训练目标的正确解读。

研究动机

程序性视频理解要求同一份视觉证据支撑多种异构任务:识别当前动作、预测下一步、推断任务类别、给出完整过程规划等。以 COIN 基准为例,五个任务的输出格式和时间跨度差异极大,Task 识别可以做 到 90% 以上,而 Proc. 规划只有 40-50%。现有视频语言模型普遍采用稠密 Transformer 解码器,所有任务共享同一组 FFN 参数,任务特化只能隐式地挤在同一前馈块里,已有研究表明这种混合会导致负迁移。最新的 VideoLLM-online-8B-v1+ 与 VideoLLM-MoD 五任务平均准确率停在 61.8%,且每个样本要激活全部 8B LLM 参数,单次请求 98.7 TFLOPs、延迟 2.8 秒。另一条路稀疏 MoE 虽然提供条件计算,但其 token 级可学习门控与用户可感知的任务边界并不对齐,难以给出稳定、可解释的任务级计算路径,也不便按任务增删能力。

本文的目标是本文目标是设计一种解码器架构,让任务身份成为显式路由变量:把 LLM 中的 FFN 逐层转换成若干任务专家外加一个始终激活的共享专家,而视觉编码器、投影层、注意力路径和共享骨干全部保持不变。每个视频-提示样本只走一条样本级任务路由,因此激活的任务专家计算量与已存储的专家数量无关——增加多少任务都不会提高单样本开销。训练时用任务标签直接监督路由;推理时任务未知时,通过提示与注册的专家描述做最近邻匹配来选路。作者希望该架构同时达成三件事:在 COIN 五任务上以更小的激活参数量超越更大基线;专家可以即插即拔地添加或移除而不破坏已有能力;并能跨域迁移,例如把 GLM-OCR 改造成同时支持 OCR 与收据关键信息抽取的双任务模型。

与已有工作不同的是,切入点上的独特性在于路由粒度与语义的双重改变。论文表 1 梳理了谱系:Switch Transformer、V-MoE、MoE-LLaVA 等 token 级可学习门控可解释性低且任务无关;MoCLE 用指令聚类做样本级条件路由,M3ViT、Cross-task MoE 在门控里用任务条件特征,但可解释性只有中等,且都不是为模块化视频语言解码器设计的。MoTE 直接用已知任务索引路由整个样本,可解释性最高;同时它把特化严格限制在 FFN 子层,注意力与骨干全部共享,避免复制整个模型。配套的专家描述注册表让部署方用自然语言增删任务定义而无需改动解码器参数,这是学习型门控天然做不到的——门控输出维度在训练时就被当时的专家数量固定死了。

核心方法

流程分四步。第一步,共享骨干:SigLIP 2 ViT-L/16-384 以 2 FPS 采样视频、上限 1200 帧,每帧取 1 个 CLS token 加 3×3 池化网格共 10 个视觉 token,经两层 MLP 投影进 Llama-3.2-1B-Instruct 的隐藏空间,与文本 token 拼接为输入。第二步,解码器改造:把每层 FFN 替换为 5 个任务专家加 1 个共享专家,均为原 FFN 的完整拷贝,隐藏状态更新为 $H^{l+1} = \tilde{H}^l + \lambda_{sh}F_{sh}^l(\mathrm{LN}(\tilde{H}^l)) + \lambda_{task}F_r^l(\mathrm{LN}(\tilde{H}^l))$,缩放因子取 1.0。第三步,训练:任务标签直接给出路由 $r=t$,LoRA 微调,损失沿用 VideoLLM-online 的语言建模加流式 EOS 双项。第四步,推理:任务未知时用冻结的 MiniLM-L6-v2(22.7M 参数)按余弦相似度匹配专家描述,五个意图测试 F1 达 100%,单次仅 4.35ms。

核心思想是让任务身份代替可学习门控来决定计算路径,并在保持模块化的同时不增加激活开销。与标准 MoE 有三点本质区别:其一,路由粒度是整个样本而非 token,所有视觉与文本 token 走同一专家,避免任务边界在生成序列内部被打碎;其二,路由信号是显式任务索引而非训练出来的门控权重,等价于免费获得完美的路由监督,省去了负载均衡损失,也让每条计算路径完全可解释、可审计;其三,专家由稠密 FFN 整体拷贝初始化而非切分,让每条任务路由保有完整的预训练前馈变换再分化。共享专家始终激活,承担通用视频-语言变换;选中的任务专家负责任务特有的监督信号与输出格式,由此把稠密解码器中纠缠在一起的两种角色解耦。消融显示这一组合在同拓扑下带来 62.9% 对 61.5%(全专家激活)与 62.1%(学习型样本路由)的优势。

方法步骤详情

第一步,专家构建:对每层 FFN 整体拷贝出 5 份(对应 COIN 五任务)外加 1 份共享专家,全部初始化自预训练稠密权重。第二步,联合训练:输入为 $(v,x,t,y)$,任务索引 $t$ 直接作为路由;每样本只有共享专家与被选中的任务专家接收梯度;可训练参数为 MLP 投影层、LoRA 适配器与专家本身,4 张 A100-80GB 完成。损失为 $\mathcal{L} = \frac{1}{N}\sum_{j=1}^{N}\left(-l_{j+1}\log p_\theta(a_{j+1}\mid H_{\le j},r) - w\,s_j\log p_\theta(\mathrm{EOS}\mid H_{\le j},r)\right)$,$w=1$;COIN 离线任务中 $s_j=0$,退化为标准路由语言建模。第三步,专家添加:新任务时插入新专家并只训练它,冻结编码器、投影层、注意力、共享与既有专家。第四步,专家移除:丢弃对应专家并从注册表删除描述。第五步,免任务索引推理:提示与专家描述嵌入做 $\arg\max$ 余弦匹配选路。

技术新颖性

技术新颖性可从三个消融维度确认。路由粒度上(表 8),同拓扑下稠密全激活 61.5%、token 级 top-1 61.4%、学习型样本级 62.1%,MoTE 显式任务路由 62.9%,说明增益主要来自任务语义对齐而非稀疏本身,Proc.+ 上的 +2.7 提升尤其说明结构化长时程输出受益最大。专家构造上(表 9),LLaMA-MoE 式的 FFN 均分成 6 份只拿到 60.3%,而整体拷贝 62.9%,说明任务路由需要每条路线保留完整的前馈容量。模块化机制上,专家描述注册表把路由定义与解码器参数解耦,这是 Cross-task MoE、MoCLE 等任务感知门控不具备的部署属性;跨域实验进一步把同一转换套到 GLM-OCR-0.9B 上,OCR 路由在 OmniDocBench v1.5 上零损失保留,同时新增 KIE 路由把 CORD Micro-F1 从 20.07% 拉到 95.79%,证明这是与骨干无关的通用机制而非视频特调。

VideoLLM-MoTE overview
Figure 1: VideoLLM-MoTE overview
MoTE decoder and expert selection
Figure 2: MoTE decoder and expert selection

实验结果

逐项看:其一,COIN 主实验(表 2)MoTE 全面领先,Step 65.1、Next 50.3、Proc. 50.5、Task 94.4、Proc.+ 54.2,平均 62.9%,超过 8B 基线 VideoLLM-online-8B-v1+ 与 VideoLLM-MoD 的 61.8%,也高于 1B/3B 对照(59.3/59.9)。其二,效率(表 3):激活 LLM 参数仅 2B(总 5.3B),28.9 TFLOPs、1.8s、37.7 tokens/s,全面优于 8B 基线,但比稠密 1B(15.2 TFLOPs、54.7 dec/s)慢。其三,专家增删(表 4):顺序添加五专家,旧任务分数不动(Step 恒 63.1),最终平均 61.0%,低于联合训练的 62.9%。其四,跨数据集(表 5):Ego4D 加 5 条 COIN 路由的单模型拿到 64.9/47.6/50.5/93.9/56.4,Fluency 51.0 超过所有基线,但 PPL 2.57 劣于专职模型。其五,跨域(表 6/7):SROIE KIE 87.90%、CORD 95.79%,OCR 路由无损。

Comparison of MoE approaches
Table 1: Comparison of MoE approaches
Comparison with prior COIN baselines
Table 2: Comparison with prior COIN baselines
Efficiency, LLM-only parameter summary and COIN average accuracy
Table 3: Efficiency, LLM-only parameter summary and COIN average accuracy
Cross-dataset task extension from online narration to offline procedural tasks
Table 5: Cross-dataset task extension from online narration to offline procedural tasks
查看结构化数据
任务指标本文基线提升
COIN 五任务平均(离线程序性视频理解) Top-1 准确率 62.9%(VideoLLM-MoTE-1B+5E) 61.8%(VideoLLM-online-8B-v1+ 与 VideoLLM-MoD,8B 模型) +1.1 个百分点,同时激活参数从 8B 降至 2B
COIN Proc.+(任务条件过程预测) Top-1 准确率 54.2% 51.5%(同拓扑 Dense 全专家激活对照) +2.7 个百分点
SROIE 收据关键信息抽取(KIE) Micro-F1 87.90%(GLM-OCR-MoTE-0.9B+2E) 72.12%(LayoutLLM-7B,最强图像基线);55.04%(GLM-OCR 原始) 较最强图像基线 +15.78 个百分点
CORD KIE Micro-F1 95.79% 20.07%(GLM-OCR 原始);97.60%(UDOP,非纯图像输入) 较自身基线 +75.72 个百分点
Ego4D 旁白流(单模型含 COIN 扩展) Fluency(越高越好) 51.0(VideoLLM-MoTE-1B+6E) 45.3(VideoLLM-online-8B-v1+,Ego4D 单独微调) +5.7
推理效率(A100,600 帧) TFLOPs / 延迟 / 解码速度 28.9 / 1.8s / 37.7 tokens/s 98.7 / 2.8s / 27.8 tokens/s(VideoLLM-online-8B-v1+) 计算量降至约 1/3.4,延迟减 1 秒,吞吐 +35.6%

局限与改进

作者坦承的局限包括:与 7B/8B 公开基线的比较是协议级的,解码器规模、视觉编码器和训练配方都不同,只有 1B/3B 对照才是受控证据;冻结式专家添加的最终平均 61.0% 低于联合训练的 62.9%,稳定性与可塑性存在取舍;提示选择器仅在每任务 50 个提示变体上评估,歧义和复合提示被明确排除在评估之外。我补充几点观察:平均提升 1.1 个百分点本身幅度不大,且 Next 任务在扩展模型中从 50.3 掉到 47.6;Ego4D 上 PPL 与 TimeDiff 全面劣于专职模型,说明共享骨干复用有代价;每加一个任务总参数线性增长(5 专家已达 5.3B),任务数上百时存储压力可观;文档实验中 GLM-OCR 基线在 CORD 上仅 20.07%,这个提升的含金量需要打折看待;此外全文未提及代码开源。

独立分析的弱点

第一,规模混淆未彻底消除:MoTE 的视觉编码器(SigLIP 2)与 LoRA 配方都可能不同于基线,应在完全相同的 8B 配方上训练 MoTE-8B 并报告受控差异。第二,共享专家单一:所有任务共用一个始终激活的 FFN,任务数增多时它可能成为容量瓶颈,可扩展为多共享专家或层次化共享结构。第三,路由完全依赖任务标签,面对开放式、定义模糊或训练时未见过的新任务,注册表匹配可能失效,可引入置信度回退或允许专家软混合。第四,顺序添加的稳定性-可塑性矛盾:可在添加后用小规模联合回放或专家间知识蒸馏,把 61.0% 向 62.9% 逼近。第五,推理延迟仍高于稠密 1B(1.8s 对 1.3s),因为要同时跑共享与路由两份 FFN,可用融合内核或共享专家蒸馏优化。第六,评测面窄:五个任务都在 COIN 内部,应在 Ego4D、EK-55 等更多程序性数据上验证泛化能力。

未来方向

作者提出的方向:把 MoTE 转换推广到更多骨干与领域,GLM-OCR 实验只是开始,可扩展到语音、音视频联合模型或具身智能体;专家描述注册表可发展成按合规需求动态裁剪能力的部署形态。基于成果可延伸的研究:其一,样本级与 token 级两级路由结合,任务专家管宏观语义、细粒度专家管帧内差异;其二,专家添加后进行周期性联合巩固(经验回放或专家合并),同时保住稳定性与峰值精度;其三,把流式场景与任务路由结合,让视频中途切换任务时路由能在线切换;其四,用更强的意图分类器或 LLM 本身做提示到专家的映射,覆盖歧义与复合提示;其五,从理论上刻画任务相似度与专家干扰的关系,指导何时该合并或拆分专家。其六,探索激活参数恒定但存储更省的构造,如低秩专家或专家间共享子结构。

复现评估

复现难度中等偏低,条件较友好。数据全部公开:COIN、Ego4D、SROIE、CORD、OmniDocBench v1.5;骨干为公开的 Llama-3.2-1B-Instruct、SigLIP 2 ViT-L/16-384 与 GLM-OCR-0.9B。训练规模可控:4 张 A100-80GB、LoRA 微调、视频 2 FPS 采样且上限 1200 帧、每帧 10 个视觉 token,1B 级模型推理时激活仅 2B LLM 参数,单卡即可部署。论文补充材料 A.1-A.3 给出模型参数、训练配置与数据采样细节,A.6 给出提示选择器协议(每任务 50 个变体、70/10/20 划分、MiniLM-L6-v2 22.7M 参数、测试 F1 100%、单次 4.35ms)。但正文没有提供代码仓库或模型权重链接,专家拷贝、路由注入与流式损失的实现需要自行完成,这是主要的复现不确定性来源。