SmartMage:面向3D场景理解的动态模态编排 SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding
让多模态大模型按问题语义动态挑选3D模态并分配专家
前置知识
多模态大语言模型 (MLLM)
把图像、视频、点云等视觉/几何信息编码成 token,拼接到大语言模型的输入序列中,从而让 LLM 具备看图理解与生成能力。3D 场景理解领域通常把 RGB-D 视频、点云、体素、BEV 等多源信号统一映射到一个共享嵌入空间(本文为 $d_v=4096$ 维)再送入 LLM 推理。
本文的方法正是构建在 MLLM 之上,理解 token 如何在不同模态间流动、LLM 如何消化这些 token,是读懂 SMART 与 MAGE 两个模块的前提。
3D 场景的异构模态
室内场景常用五类表示:RGB 视频提供外观与纹理,深度 (Depth) 提供度量几何,BEV 鸟瞰图提供全局布局,点云 (PC) 提供细粒度表面结构,体素 (Voxel) 提供体积上下文。它们各自编码场景的不同侧面,token 数量也不同(本文 $N_{rgb}=480$、$N_{dpt}=480$、$N_{pc}=64$、$N_{bev}=15$、$N_{vox}=100$)。
整篇论文的核心论点就是「不同问题需要不同的模态组合」,必须先搞清楚每种模态擅长什么,才能理解为什么要做动态选择。
混合专家与软路由 (MoE / Soft Routing)
MoE 用一组并行的专家 FFN 替换单一前馈层,每个 token 通过门控函数 (gating) 计算各专家权重,只激活 top-$k$ 个专家,从而以稀疏计算换取更大模型容量。软路由 (soft routing) 让 token 到专家的映射可学习且动态,公式为 $\pi_{i,e}^{(\ell)}=\mathrm{softmax}(w_e^{(\ell)\top}h_i^{(\ell)}/\tau)$。
MAGE 模块本质上是把模态先验注入到 MoE 的门控中,引导专家按模态特化。不懂 MoE 的路由机制,就看不出 MES 改了什么、为什么能让专家产生分工。
ScanNet 及其下游基准
ScanNet v2 包含 1513 段 RGB-D 视频、707 个室内场景,带相机位姿、实例分割与物体包围框。它衍生出 ScanQA/SQA3D(3D 问答)、Scan2Cap(密集描述)、ScanRefer/Multi3DRefer(视觉定位)等任务,是 3D 场景理解的事实标准数据底座,本文也在其上统一训练。
本文的五个评测基准和新增诊断集 ScanFacet 都建立在 ScanNet 之上,理解这套评测体系才能判断各项提升的意义。
Qwen3-VL 视觉骨干
Qwen3-VL-8B-Instruct 是本文初始化所用的视觉语言骨干:视觉编码器把图像切成 16×16 patch,经 27 层 Transformer 与 PatchMerger 聚合后映射到视觉-语言表示空间,$d_{rgb}=1152$。本文冻结视觉编码器,仅训练轻量 adapter、SMART 与 MAGE 路由层。
所有模态特征都经 Qwen3-VL 视觉塔编码,MAGE 也在 Qwen-LLM 的第 8/12/16/20/24/28 层插入 MoE,知道这点才能复现工程细节。
研究动机
现有多模态 3D 理解方法(如 Chat-Scene、Video-3D LLM、Ross3D 等)虽然在不断堆叠更多模态,但普遍采用固定的模态组合——把 RGB、深度、BEV、点云、体素一股脑喂给模型,隐含「所有模态对每个问题都同等有用」的假设。然而真实场景里不同问题对模态的偏好差异极大:问「毯子是什么颜色」几乎只靠 RGB,问「沙发什么形状」更受益于点云/体素的几何信息,问「吉他和床的距离」则依赖 BEV 或体素的空间布局。当无关模态被无差别输入时,会引入语义噪声、稀释推理信号,信息量高的模态反而得不到足够注意力,既浪费算力又可能适得其反。论文在 Table 4 的固定模态消融里清楚展示了这种反直觉现象:设置 8(RGB+BEV+Depth)在多个基准上反而优于使用更多模态的设置 9、设置 10,说明简单堆模态存在冗余与干扰。换言之,「多多益善」在固定融合范式下并不成立。
本文的目标是本文要打造一个统一的 MLLM——SmartMage,让它能针对每个查询「按需取用」模态,而不是机械地全盘接收。具体目标有三:其一,根据问题的语义意图动态决定哪些模态该参与推理,RGB 作为主模态固定保留,其余辅助模态按需挑选,从而在节省计算的同时提升精度;其二,在 LLM 内部让专家按模态特化,使得被选中的模态能被专门的处理路径高效消化;其三,用一个可控的诊断基准揭示「问题类型—模态组合」之间的依赖关系,验证动态编排确实在每种语义类别上都带来收益。可量化的指标包括在五个 3D 基准上全面超越 SOTA、在 RGB-only 视频基准上保持竞争力,以及训练迭代速度相比 Ross3D 提升 2.0–2.6 倍。
与已有工作不同的是,以往工作要么在「加什么模态」上做文章(拼命扩模态集合),要么在「怎么融合」上做文章(设计更复杂的注意力或投影),却几乎没人系统追问「这个问题到底该用哪些模态」。SmartMage 抓住的正是这个被忽视的空白:把多模态推理显式拆成两步——先做语义引导的全局模态选择(SMART),再做模态感知的局部专家分配(MAGE)。更独特的是,它不只依赖文本先验,还引入了模态质量评估(用特征激活统计衡量每个模态是否可靠)和文本-模态相似度,三路信号融合后再路由;并在 MoE 中用可学习的模态-专家亲和矩阵 $A\in\mathbb{R}^{M\times E}$ 给出门控先验,把原来随机竞争的专家变成有结构的分工。这种「先选对料、再用对灶」的双层编排视角,是本文区别于一切固定融合或纯 MoE 工作的本质切入点。
核心方法
直觉上,SmartMage 像一个会看人下菜的大厨:面对一道「问颜色」的菜,它只挑 RGB 这味主料;面对「问形状」的菜,就额外加点点云/体素提味;而且厨房里有专门管颜色、专门管几何的灶台(专家),选好的料会被送到最合适的灶台烹饪。技术路线上,整个流程分四段:先用 Omni-modal 特征提取器把 RGB-D 视频、BEV、点云、体素编码进统一的 4096 维空间(RGB/Depth 各 480 token、点云 64、BEV 15、体素 100);再用 SMART 做全局调度,融合语义先验、文本-模态相似度与模态质量三类信号,输出一个模态选择掩码,固定保留 RGB,按需保留 0–3 个辅助模态;接着把筛选后的 token 送入 MAGE,它在 Qwen3-VL 的第 8/12/16/20/24/28 层(每层 8 个专家、top-2 路由)插入稀疏 MoE,并用模态感知专家推测 (MES) 把模态先验注入门控;最后用交叉熵加语义对齐损失和专家分配损失端到端微调。整套设计把「静态拼接」升级为「语义感知、上下文自适应的路由」。
全文最核心的创新,是把「多模态推理」明确解耦为两个可被显式监督的阶段:语义引导的模态选择(SMART)与模态感知的专家特化(MAGE)。与已有方法的本质区别在于——它不再让模态选择停留在「全要」或「人工配置」,而是用一个可微路由器依据三类信号实时决策:语义先验估计器 (SPE) 从文本预测偏好 $p$;语义相似度评分器 (SSS) 用跨注意力抽取每个模态的指令相关表示再与全局意图算余弦相似度 $s_m$;模态质量评估器 (MQE) 从特征范数统计量化可靠性 $q_m$。三路融合为 logits $z=\alpha_p p+\alpha_s s+\alpha_q q+b$ 再叠加 RGB 证据门控。MAGE 引入可学习亲和矩阵 $A$,由 MES 先预测 token 级模态分布 $r_i$,再混合成专家先验 $\tilde{\pi}_{i,e}=\sum_m r_{i,m}\tilde{\pi}_{m,e}$ 正则化门控。这样「用哪些模态」与「让哪些专家处理」第一次被语义一致地协同起来。
方法步骤详情
流程分五步。(1) 预处理:用 FoVSR 关键帧算法(比基于深度的 MC 快约 100 倍)选 32 帧 128×123 RGB-D,并生成 BEV、8192 点云、0.02 m 体素。(2) 特征提取:RGB/Depth/BEV 用 Qwen3-VL 视觉塔,点云用 PointNet++,体素用 Mask3D,各 adapter 投影到统一空间。(3) SMART 全局路由:先验 $p$、相似度 $s$、质量 $q$ 融合为 logits $z$ 并经 RGB 证据门控,按 $\rho=0.8$($k_{max}=3$)选辅助模态掩码。(4) MAGE 局部处理:在 LLM 第 8/12/16/20/24/28 层,MES 预测 token 级模态分布,经亲和矩阵 $A$ 得专家先验,引导 top-2 路由到 8 个专家。(5) 训练:冻结编码器与大部分 LLM,仅训练 adapter、SMART、路由器与专家,损失 $\mathcal{L}=\mathcal{L}_{ce}+\mathcal{L}_{SMART}+\mathcal{L}_{MAGE}$。
技术新颖性
技术新颖性体现在三处。第一,SMART 是首个把语义先验、文本-模态相似度、模态质量三类异质信号统一到模态级路由里的机制,并创新性地用「特征激活统计」推断模态可靠性(强度区分结构 vs 噪声、稀疏度度量信息量、稳定性判断是否退化),这一点在 3D 感知里前所未见。第二,MAGE 把模态先验第一次显式注入稀疏 MoE 的门控:通过可学习的模态-专家亲和矩阵 $A$ 与 token 级模态分布 $r_i$ 构造专家先验,用专家校准损失 $\mathcal{L}_{ec}$(类 KL 散度)拉进门控与先验,把原本「无结构随机竞争」的专家训练转成「模态一致的分工」。第三,配套的 FoVSR 关键帧算法把基于深度的覆盖估计换成了纯相机位姿的体素可见性测试,复杂度从 $O(K|F||V|)$ 降到 $O(K|F_{valid}||V_{scene}|)$,实测提速约 100 倍。此外,作者还提出诊断基准 ScanFacet,把 ScanQA/SQA3D 的问题用 LLM 辅助流程(语义解析→意图归一化→自一致性过滤→人工复核,人工修正不到 3%)归为八类语义,使模态偏好首次可被细粒度度量。
实验结果
SmartMage 在五个 3D 基准全面刷新 SOTA。3D 问答:ScanQA 32.6 EM@1、SQA3D 66.8,比 Ross3D 高 +1.8、+3.8,SQA3D 细分 What/Is/How/Which 均最佳。密集描述:Scan2Cap CIDEr@0.5=88.7(比 Video-3D LLM +4.9)、@0.25=93.8(比 PQ3D +6.7)。视觉定位:ScanRefer Acc@0.5=59.5(+5.1)、Multi3DRefer F1@0.5=60.7(+6.4),带干扰物场景 F1@0.5=55.1 优于 GPT4Scene-HDM。消融证明 SSS 是 SMART 最关键部件(去掉 ScanQA 从 29.8 跌到 27.1)、MES 对 MAGE 重要(去掉 SQA3D 从 64.5 跌到 63.1),$\mathcal{L}_{sem}$ 贡献最大。Table 4 显示自适应选择全基准最优,固定组合里设置 8(RGB+BEV+Depth)反优于用更多模态的设置 9/10,印证「堆模态有上限、动态编排最优」。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| ScanQA 3D问答 | EM@1 | 32.6 | Ross3D 30.8 | +1.8 |
| SQA3D 3D问答 | EM@1 | 66.8 | Ross3D 63.0 | +3.8 |
| Scan2Cap 密集描述 | CIDEr@0.5 | 88.7 | Video-3D LLM 83.8 | +4.9 |
| ScanRefer 视觉定位 | Acc@0.5 | 59.5 | Ross3D 54.4 | +5.1 |
| Multi3DRefer 视觉定位 | F1@0.5 | 60.7 | Ross3D 54.3 | +6.4 |
| ScanFacet 颜色理解(诊断) | CIDEr | 115.0 | 固定全模态 99.0 | +27.1 |
局限与改进
作者在附录 F 坦承两类局限。其一,受 LLM token 预算限制须严格控输入:RGB 用 FoVSR 选 32 帧可能漏关键视角,点云被 FPS 下采样到 8192 点会损失小目标细粒度几何,当其他模态补充不足时这些折损会传导到性能。其二,训练数据本身有噪声——模糊多视图与标注歧义会干扰精细定位。失败案例(Fig. 16)印证两点:一是标注歧义,「teal 沙发旁圆茶几」模型选 object 13 而真值是 object 21,但 13 其实也符合描述,错在标注;二是感知失败,跨视图光照不一致致颜色偏差,把黑色毛巾误判为 object 9。我额外观察到:训练与评测全基于 ScanNet 单一室内源,泛化到室外、大尺度或真实机器人采集数据未验证;ScanFacet 样本仍源自 ScanQA/SQA3D 非全新采集;RGB-only 评测仍明显弱于专门 2D 视频模型(LLaVA-OneVision-7B VSI-Bench 47.7 vs 本文 26.5);MQE 用激活统计作质量代理属启发式,能否真正反映「深度图被反射面污染」存疑。
独立分析的弱点
第一,模态选择本质是离散决策,本文用 Gumbel-Softmax 训练、确定性 softmax 推理,但 $k_{max}=3$、$\rho=0.8$ 的硬约束使选择较粗,可在边界样本引入软加权或 straight-through 估计缓解训练-推理不一致。第二,FoVSR 只用相机位姿估覆盖、忽略图像内容,可能漏选纹理丰富但位姿普通的帧,可融合语义熵/检测显著性做内容感知选帧。第三,点云固定 8192 点、体素 0.02 m,对大场景欠采样、对小物体过粗,可用层次化或多分辨率 token 让表征随尺度自适应。第四,专家数与插层都是手工拍板,Table 16/17 显示 30 专家饱和、深层最优,但缺自动化搜索,可用 NAS 或层重要性评分做可学习层选择与专家剪枝。第五,泛化边界窄:仅 ScanNet 室内、仅 5 类模态,缺激光雷达/红外等模态与 EmbodiedScan、Habitat 等真实机器人数据,改进方向是扩模态库并在具身交互基准验证。第六,MQE 是特征统计代理,未直接建模传感器退化,可换成显式深度/光照置信度估计。每个弱点都对应明确改进路径,整体框架可扩展空间很大。
未来方向
作者明确提到的方向:缓解 token 预算与下采样带来的信息损失(更智能的关键帧选择、更高密度的点云/体素),以及提升训练数据的标注与成像质量。基于本文成果可延伸的方向包括:其一,把 SMART/MAGE 的双层编排推广到更多模态(激光雷达、红外、事件相机、触觉)和更开放的场景(室外、自动驾驶),验证「按需取用」在更大模态库上的扩展性;其二,把模态选择与具身动作耦合——让机器人在交互中主动决定「下一步看哪个模态/视角」,形成感知-决策闭环;其三,把可学习亲和矩阵 $A$ 与专家特化用于跨模态检索、模态缺失场景的鲁棒推理,甚至做模态蒸馏(用强模态教弱模态);其四,用 NAS 或元学习自动搜索最优专家数与插层位置;其五,把 ScanFacet 思路扩展成覆盖室内外、含动态场景的更大规模诊断基准,持续量化模态-语义依赖。
复现评估
复现友好度较高。数据全部基于公开的 ScanNet v2 及下游数据集(ScanQA、SQA3D、Scan2Cap、ScanRefer、Multi3DRefer),数据格式与 prompt 模板在附录 A.2 给出。模型上骨干用开源 Qwen3-VL-8B-Instruct,点云 PointNet++、体素 Mask3D、BEV 正交投影均公开;SMART/MAGE 结构、损失 $\mathcal{L}=\mathcal{L}_{ce}+\mathcal{L}_{SMART}+\mathcal{L}_{MAGE}$ 与超参(lr 2e-5、$\lambda_{sem}=0.5$、MoE 层 8/12/16/20/24/28、8 专家 top-2、32 帧 128×123、8192 点、0.02 m 体素)都写得很细。算力门槛中等偏上:2×H800、batch 64、1 epoch、BF16 + DeepSpeed ZeRO-2,单迭代 47.4 s。难点在于 BEV 渲染、Mask3D 实例分割、ScanFacet 的 LLM 辅助分类需较多工程搭建。
论文图表
三幅子图:(a) 展示颜色、距离、形状等不同问题分别偏好 RGB、BEV/体素、点云;(b) 对比以往 MLLM 固定融合与 SmartMage 自适应选择 + 专家分配;(c) 显示自适应方法在多个语义类别上优于固定模态。
这是理解整篇论文动机的入口图,直观回答了「为什么要动态选模态」,没有它读者难以抓住核心论点。
上例为标注歧义(圆茶几 object 13 与 21 都符合描述);下例为光照/颜色不一致导致黑色毛巾被误判为 object 9。
诚实展示模型失败模式,帮助读者理解局限性的具体来源,是评估方法边界的必要材料。