让 RGB 成为视觉的通用语言 Let RGB Be the Language of Vision
用RGB统一视觉任务的输入输出,冻结图像编辑器零样本完成25项感知与生成任务
前置知识
RGB 统一接口(RGB as Universal Interface)
核心思想是模仿大语言模型中「文本作为通用输入输出格式」的范式,把所有形式的视觉信息(自然图像、分割掩码、深度图、法线图、姿态骨架等)都统一编码为 RGB 图像。这样模型内部只需一套图像编码器和解码器,不同任务共享相同的视觉接口,像语言模型处理文本一样处理视觉信号,从而摆脱每类信号都需专用编解码器和适配器的局面。
这是整篇论文的理论根基。理解这一概念,才能明白作者为何坚持「不引入任何任务专用参数」,以及为什么把深度、分割等结构化信号反复在 RGB 与任务格式之间做无损可逆转换。
图像编辑模型(Image Editing Model)
指基于多模态扩散 Transformer(MMDiT)的指令式图像编辑器,接收一张输入图像和一段自然语言指令,输出一张遵循指令的编辑后图像。本文使用的 Qwen-Image-Edit 是 20B 参数的 MMDiT,耦合了 Qwen2.5-VL 视觉语言模型与图像 token 的 VAE;LongCat-Image-Edit 是美团 6B 双语编辑器;FireRed-Image-Edit 采用双流多模态扩散设计。它们被当作「黑盒 RGB-to-RGB 编辑器」使用,作者不增删、不微调任何层。
论文的全部能力都源自这些预训练编辑骨干的视觉先验。理解编辑器的工作方式(去噪步数、CFG、分辨率)是理解各任务结果差异(如 LongCat 因生成稳定性差需 50 步)的前提。
可控图像生成与 ControlNet
传统可控生成的标准做法是给文本到图像骨干挂接一个可训练的「控制编码器副本」(如 ControlNet)注入条件信号(Canny 边缘、深度、分割图),或学习小型每条件适配器(T2I-Adapter)。每新增一种条件类型都需要单独训练一个编码器或适配器,工程成本高、难以统一。RINO 的对照组正是这类任务专用、需训练的条件注入方法。
这是生成任务的对比基线。读懂 ControlNet 范式,才能体会 RINO「把深度图/分割图当作普通 RGB 条件图像喂给编辑器、零样本即可」的本质差异和新颖性。
零样本迁移(Zero-shot Transfer)
指模型在没有任何目标任务训练数据、没有任务专用参数的情况下直接完成任务。本文的 RINO-Zero 完全依赖编辑骨干在网络规模预训练中可能已经见过的少量非自然视觉信号(如分割掩码、深度图)所获得的先验,靠无参数的颜色解码/几何转换规则把 RGB 输出还原成任务格式进行评测。
论文反复强调「zero-shot」,这是衡量方法普适性的关键。理解零样本的含义,才能正确看待它与任务专用专家模型(如 Depth Anything、Mask R-CNN)之间仍有差距这一结论。
仿射不变深度评估(Affine-invariant Evaluation)
生成式编辑器输出的是相对深度,尺度与偏移未知。标准做法是对每张图用最小二乘拟合一个尺度 $s$ 和偏移 $t$ 到真值深度,再计算 $\delta_1$(相对误差阈值内的像素占比)和 AbsRel(绝对相对误差)。 disparity-space(视差空间,即逆深度)是 MiDaS/Depth Anything 的惯例,linear depth-space(线性深度空间)是 Marigold 的惯例,两者会给出不同的分数。
深度是论文最亮眼的任务之一。理解仿射不变协议和视差/线性两种空间约定,才能看懂为什么同一模型在 Table 1 与 Table 2 中分数差异巨大(如 KITTI 上 Qwen 的 $\delta_1$ 从 0.901 掉到 0.413)。
研究动机
在自然语言领域,文本已经成为大语言模型几乎处理所有任务的通用输入输出格式,一个训练充分的模型就能灵活支持各种下游应用。然而视觉远未达到这种统一程度:不同类型的视觉信息往往需要各自专属的表示——自然图像用 RGB、分割用 one-hot 掩码、深度用连续几何图、姿态用关键点坐标。每种格式通常都要设计专门的编码器、解码器,外加额外的适配器组件把它们连接起来。这种表示与结构上的壁垒使视觉模型难以像语言模型那样支持自由形式的交互,模型往往难以在单个任务之外有效泛化,多数视觉基础模型仍更接近「任务专用专家」而非真正通用的视觉学习者(如 SAM、CLIP、Stable Diffusion 的各类专用变体)。具体而言,估计任务需要专用预测头,生成任务需要专用控制编码器,二者架构与输出空间完全割裂,从未在共享接口下统一。
本文的目标是本文的总体目标是验证「RGB 能否像文本一样成为视觉的通用接口」。作者希望构建一个统一的视觉表示学习范式 RINO(RGB In and RGB Out),让所有视觉输入和输出信号都以 RGB 格式表达:自然图像、分割掩码、深度图、姿态图、边缘图等结构化信号共享同一套图像编码与解码系统。在此基础上,用一个冻结的、预训练好的图像编辑模型(如 Qwen-Image-Edit)作为黑盒,在不引入任何任务专用头、编码器、解码器或适配器参数的前提下,统一处理尽可能广泛的视觉任务——既包括密集理解(深度、法线、分割、检测、姿态),也包括条件化生成(深度/分割/姿态/实例/Canny 条件生成),从而考察这种单一 RGB 接口能在多大范围内、多大程度上接近任务专用专家模型。
与已有工作不同的是,已有工作 Vision Banana 首次提出用生成模型把理解任务的输出参数化为 RGB,但它是基于私有骨干,只在部分理解任务上评测,且开源模型是否具备同样行为尚不清楚(Liu et al. 仅在开源编辑器上做了类似验证)。本文的独特切入在于三点:第一,把范式同时推到理解与生成两个对偶方向——理解是「图像→RGB 结构信号」,生成是「RGB 结构信号→图像」;第二,完全基于公开开源编辑器(Qwen-Image-Edit、LongCat、FireRed)作为冻结黑盒,只加无参数的 RGB 转换模块,不微调任何层;第三,评测范围远超以往,覆盖 20+ 任务/基准、横跨密集理解、3D 估计与条件化生成,系统性量化「全零样本、零训练」设置下 RGB 接口能走多远。
核心方法
直觉上,RINO 借用语言模型「文本即通用接口」的思路,把视觉世界也压缩成一种通用语言——RGB。技术路线是把一个预训练图像编辑模型 $F$(如 Qwen-Image-Edit)当作黑盒 RGB-to-RGB 编辑器:给它一张输入图像 $x_{\text{img}}$ 和一段文本指令 $x_{\text{text}}$,它输出一张图像 $y_{\text{img}}$ 和可选文本 $y_{\text{text}}$,即 $y_{\text{img}}, y_{\text{text}} = F(x_{\text{img}}, x_{\text{text}})$。框架不引入任何任务专用头、编码器、解码器或适配器参数,所有视觉信息都以 RGB 形式被 $F$ 内部统一的图像编码器/解码器处理。任务相关的转换(如 RGB 掩码↔类别标签、RGB 深度图↔深度值)只通过轻量、无参数的数据转换模块在推理前后完成,模型内部所有视觉推理都走统一的 RGB 接口。本文三个骨干:Qwen-Image-Edit(20B MMDiT)、LongCat-Image-Edit(6B 双语,需 50 步)、FireRed-Image-Edit(双流多模态扩散)。
核心创新是把理解与生成纳入同一个 RGB/text-to-RGB/text 范式,并视二者为对偶问题。理解任务中输入 $x_{\text{img}}$ 是自然图像、$x_{\text{text}}$ 指定任务、输出 $y_{\text{img}}$ 是结构信号(如 RGB 分割掩码或 RGB 深度可视化),评测时用无参数转换器把 RGB 还原成任务格式(颜色映射得类别、亮度解码得深度)。生成任务中 $x_{\text{img}}$ 是 RGB 形式的视觉条件(语义布局、姿态骨架、深度图、边缘图、掩码),$x_{\text{text}}$ 描述期望生成,模型输出自然图像。例如语义分割是「图像→RGB 掩码」,分割条件生成是其对偶「RGB 掩码→图像」;姿态估计与姿态引导生成同理对偶。与已有方法的本质区别在于:完全无训练、无适配器、无专用编解码器,仅靠无参数转换和编辑骨干的视觉先验,就能用一个模型在 25 个任务上完成迁移,类似语言模型基于文本的统一操作方式。
方法步骤详情
方法步骤按任务类型分两类。理解任务(统一输出为 RGB):以深度估计为例,提示编辑器「把输入图重新绘制为灰度深度可视化(近处更亮、远处更暗)」,再从生成图像的逐像素亮度恢复稠密相对深度图;法线估计则提示「重绘为标准法线图(表面朝向用颜色编码)」,再解码回逐像素单位法线;语义分割提示「把当前图存在的类别涂成对应颜色」,并做层级策略(ADE20K 先预测 10 个超类再细化),辅以无参数精修(局部多数滤波、去除小连通域);检测/实例分割用「逐类剪影涂白」并指定实例数,阈值化后用形态学开运算切分连通块;全景分割用「每类一种命名色、背景黑色」并按最近色匹配解码;姿态估计提示「重绘为 OpenPose 彩色骨架」,用与颜色无关的解码器(前景距离变换峰值+与标准直立骨架模板匹配)恢复 COCO-17 关键点;指代表达提示「把目标物体涂成纯红、其余不变」,用编辑前后差分取最大变化连通块同时得到框和掩码。生成任务(统一输入为 RGB):把深度图、分割图、姿态骨架、实例图、Canny 边缘图都作为普通 RGB 条件图像连同文本指令一起喂给编辑器,生成遵循条件的自然图像,不接任何深度/分割/姿态专用编码器或 ControlNet 分支。骨干默认 12 步去噪、CFG=5.0,LongCat 用 50 步;生成任务各编辑器用各自推荐采样配置(如分割条件生成 Qwen/FireRed 步数 40、CFG 4.0)。条件保真度均用「从生成图反提取条件再比对」度量(深度用 DPT-Large RMSE-255、分割用 Mask2Former 重提取 mIoU、实例用 YOLOv8m-Seg、Canny 用 cv2.Canny 边缘 F1)。
技术新颖性
技术新颖性体现在四方面。第一,统一范围前所未有:首次在同一个 RGB-to-RGB 框架下同时覆盖估计与生成这对镜像任务,且横跨 25 个任务/基准(密集理解、3D 几何、条件化生成),远超 Vision Banana 主要聚焦理解的设定。第二,完全无参数、全零样本:骨干作为冻结黑盒,只依赖网络规模预训练里残留的少量非自然视觉信号先验,不加任何任务专用层、不微调,作者把当前版本命名为 RINO-Zero。第三,对偶视角:把条件化生成重新表述为视觉理解的对偶问题(RGB 掩码→图像 vs 图像→RGB 掩码),从而把传统上需要 ControlNet 适配器的可控生成,转化为无适配器的「吃 RGB 条件图」流程。第四,工程上的无参数转换设计:颜色到类别的映射、亮度到深度的解码、骨架峰值解码、形态学开运算切分实例等,全部是确定性的、可逆的几何/颜色规则,把「任务格式」与「模型内部表示」彻底解耦,使同一套骨干理论上可无限扩展任务类型。
实验结果
核心发现是:一个全零样本、零训练的冻结编辑器,能在 25 个任务上产生有竞争力或接近专家模型的结果。深度估计(Table 1,视差空间仿射不变):Qwen-Image-Edit 在 DIODE-indoor 上 $\delta_1$ 达 0.938、NYUv2 达 0.927、KITTI 达 0.901,逼近 Depth Anything V2(0.979/0.946/0.952),其中 DIODE-indoor 仅差约 1.4 个点;但在线性深度空间(Table 2)宽范围场景(KITTI、iBims-1)分数大幅下滑(KITTI $\delta_1$ 仅 0.413)。表面法线(Table 3):FireRed-Image-Edit 在 NYUv2/iBims-1/DIODE-indoor 上平均角误差 17.73/18.62/17.25 度,仅略逊于专家 DSINE(16.4/17.1/18.45),是编辑器中最佳。语义分割(Table 4/5):LongCat 在 Pascal VOC mIoU 49.68、ADE20K 10 类 Qwen 40.37 mIoU 甚至超过 MaskCLIP;但 150 类细粒度设置明显退化(Qwen 12.57 mIoU)。检测与实例分割(Table 6)最具挑战,Qwen 框 AP50 仅 16.3、掩码 AP50 13.9,远低于 Mask R-CNN 的 63.5,说明定位可行但精度不足。全景分割(Table 7)揭示关键洞察:Qwen 的 SQ(分割质量)高达 64.8–74.3,接近专家级掩码对齐,但 RQ(识别/匹配质量)仅 15–17,瓶颈在实例关联而非空间分割。姿态估计(Table 8):经相似性对齐后 PA PCK@0.2 FireRed 达 0.795,逼近专家。指代表达(Table 9):Qwen REC Prec@0.5 为 51.8。生成任务更亮眼:深度条件生成(Table 11)Qwen RMSE-255 33.83、FID 19.44,优于多个训练型适配器基线;分割条件生成(Table 12)三编辑器在 ADE20K 聚焦 46 mIoU、COCOStuff 约 37 mIoU,全面超过任务训练的 ControlNet++(ADE20K 43.64 mIoU);实例图条件生成(Table 14)LongCat AP 28.0、AR 44.2 超过训练版 InstanceDiffusion(AP 27.1、AR 38.1);姿态条件生成(Table 13)FireRed CAP 68.09、FID 10.66、CLIP 34.24 与训练模型可比。唯一的明显短板是 Canny 条件生成(Table 15),Qwen 边缘 F1 仅 14.90,约为 ControlNet++(37.04)的 0.4 倍,消融证明信息来自边缘图本身而非字幕(仅字幕 F1 6.75、用 VLM 描述边缘再喂文本 F1 7.79)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 单目深度估计(DIODE-indoor,视差空间仿射不变) | $\delta_1$(越高越好) | Qwen-Image-Edit 0.938 | Depth Anything V2 0.952 | 零样本仅差约 1.4 个点,接近专家级 |
| 表面法线估计(NYUv2 平均角误差) | Mean 角误差(度,越低越好) | FireRed-Image-Edit 17.73 | DSINE 16.4 | 零样本仅差约 1.3 度 |
| 语义分割(ADE20K 10 类) | mIoU(越高越好) | Qwen-Image-Edit 40.37 | MaskCLIP 39.26 | 零样本反超零样本专家 |
| 全景分割(分割质量 SQ) | COCO SQ(越高越好) | Qwen-Image-Edit 74.3 | Mask2Former(PQ 整体 57.8) | SQ 接近专家级掩码对齐,瓶颈在 RQ |
| 分割图条件图像生成(ADE20K) | mIoU(条件保真度) | Qwen-Image-Edit 46.24 | ControlNet++ 43.64 | 零样本超过任务训练基线约 2.6 mIoU |
| 实例图条件图像生成(COCO2017) | mask AP | LongCat-Image-Edit 28.0 | InstanceDiffusion 27.1 | 零样本 AP 与 AR 均超训练基线 |
| Canny 条件图像生成 | 边缘 F1(越高越好) | Qwen-Image-Edit 14.90 | ControlNet++ 37.04 | 明显落后,约为训练模型的 0.4 倍 |
局限与改进
作者明确承认的局限有三点。首先,RINO 的强迁移能力依赖通用图像编辑骨干(如 Qwen-Image-Edit、FireRed),而这些骨干的网络规模预训练数据里虽然可能已包含分割掩码、深度图等多样化视觉信号,但这类信号很可能只占预训练分布的很小一部分,导致在某些具体应用上 RINO 与领域内专家模型仍有差距。其次,细粒度任务表现明显退化:ADE20K 150 类细粒度分割的 mIoU 仅 12.57,说明模型已捕获丰富语义但缺乏足够领域专用知识来对齐精细类别名。第三,Canny 二值边缘条件生成在可控性、真实性与提示对齐三个维度上全面落后于训练控制器(F1 14.90 vs 37.04)。从结果表还能看到更多结构性瓶颈:检测/实例分割(框 AP50 16.3 vs Mask R-CNN 63.5)、开放词表实例分割的存在性检测(IL_MCC 接近 0,因为编辑器即使查询词不存在也会画掩码)差距很大;全景分割的识别质量 RQ 仅 15–17,thing 类小目标和相邻实例常被合并或漏检;姿态估计绝对定位精度差(raw PCK@0.05 Qwen 仅 0.060),需相似性对齐才能体现结构。这些说明 RGB 接口在「空间分割」上强、在「实例关联/存在性判断/精细分类」上弱。
独立分析的弱点
第一个弱点是细粒度类别对齐能力不足。ADE20K 150 类细粒度 mIoU 仅 12.57,模型虽能产出结构合理的掩码,但难以把预测与 150 个精细类别名精确对齐。改进方向是层级提示(本文 10 超类→细化已初见成效)结合少量类别名监督的指令微调。第二个弱点是实例级任务的实例关联与存在性检测。全景分割 RQ 仅 15–17、开放词表实例分割 IL_MCC 接近 0,编辑器倾向「无论查询词是否存在都画掩码」,且会过检测/过分割。改进方向是引入显式的存在性判别(如外挂 MLLM 闸门,Vision Banana 正是靠此提升 IL_MCC),并在 RGB 接口中加入实例计数/区分的更强线索。第三个弱点是二值稀疏条件(Canny)的可控性差(F1 仅 0.4×训练模型),因为细边缘在生成式重绘中容易被忽略。改进方向是把二值边缘转为更稠密的 RGB 表征或对编辑器做边缘条件微调。第四个弱点是绝对尺度/定位精度差(深度需仿射对齐、姿态需相似性对齐),根源是生成器输出相对量。改进方向是引入度量先验或在 RGB 编码中携带尺度信息。第五个弱点是高成本:25 个任务需要逐图逐类多次调用大编辑器(如逐类剪影涂白、ADE20K 层级),推理开销远高于专用轻量头,难以实时部署。
未来方向
作者明确提出的未来方向:用标准图像编辑数据混合一定比例 RGB 格式的非自然视觉数据(如分割掩码、深度图)对现有编辑模型做指令微调,让 RINO 接口在训练阶段就出现,从而在更广任务上闭合与专家模型的差距;并希望把 RGB 统一范式扩展到更广视觉领域,包括 3D 视觉、视频与世界模型。基于本文成果可延伸的方向包括:研究无参数 RGB 转换规则的自动学习(从手工颜色映射走向可微、可学习的编解码,但仍保持轻量);探索把存在性判别、实例关联作为「RGB 文本指令」的一部分让编辑器原生支持;将 RINO 推到时序/视频任务(光流、跟踪、视频分割)以验证 RGB 接口对动态信息的扩展性;研究多编辑器骨干的「视觉语言」是否可互换(不同骨干迁移能力差异显著,LongCat 在 Cityscapes 全景仅 1.0 PQ),从而理解通用视觉接口所需的预训练先验下限;以及把理解与生成对偶性用于自训练/数据增广——用生成器产 RGB 条件图、再用理解器解码,形成闭环蒸馏。
复现评估
复现性总体较好但有门槛。代码已在 https://github.com/yangtiming/RINO 开源,三个骨干(Qwen-Image-Edit 20B、LongCat 6B、FireRed)均为公开权重,可直接作为黑盒调用。方法本身完全零训练、零参数,核心是提示工程加无参数转换模块(颜色映射、亮度解码、形态学开运算、距离变换峰值解码),论文对每个任务的提示措辞、去噪步数、CFG、解码流程描述较细(如分割 12 步 CFG=5.0、LongCat 50 步、ADE20K 层级策略、指代表达的差分取最大连通块)。评测协议和数据集(NYUv2、KITTI、DIODE-indoor、iBims-1、Cityscapes、Pascal VOC、ADE20K、COCO、RefCOCOg、SA-Co/Gold、MultiGen-20M、Human-Art)均为标准公开基准,指标定义清晰(仿射不变 $\delta_1$/AbsRel、角误差、mIoU、AP、PQ/SQ/RQ、PCK、RMSE-255、FID、CLIPScore)。主要挑战在算力与工程:20B 编辑器在 25 个任务、每任务数千张图、部分需逐类多次调用(如检测/开放词表)和多样本采样(Canny 每 4 样本)下,推理开销巨大,对 GPU 资源要求高;部分消融(如 VLM 重字幕、下采样到 512 的对照)说明结果对提示丰富度、分辨率敏感,复现需严格对齐这些设置。此外作者未给出每个任务完整超参表,部分结果(外部训练基线)直接引用原论文而非本地重测,存在评测口径差异风险。
论文图表
表对比监督模型(Mask DINO、Cascade Mask R-CNN、Mask R-CNN、Mask2Former)与三编辑器在 COCO val2017(oracle 类/计数剪影协议)的框与掩码 AP。Qwen 框 AP50 16.3、掩码 AP50 13.9,远低于 Mask R-CNN 63.5;LongCat 最弱(AP50 6.3)。
这是 RINO 最弱的任务,定量证明零样本在实例级定位上的巨大差距,是局限分析的核心数据。
表对比监督专家(EoMT、ViT-P、OneFormer、Mask2Former,报 PQ)与三编辑器(报 SQ 并括号给 PQ/RQ)。Qwen 的 SQ 高达 64.8/71.5/74.3,掩码对齐接近专家级,但 RQ 仅 13.6–17.4,瓶颈在识别与实例关联;Cityscapes 上 stuff PQ 22.4 而 things PQ 仅 1.5。
这张表提供论文最深刻的洞察:RINO 的短板在「识别/匹配」而非「空间分割」,对改进方向(存在性判别、实例关联)有直接指导意义。
表对比姿态专家(ViTPose、Keypoint R-CNN、YOLO-pose、SAM 3D Body)与三编辑器在 raw 与对齐(PA)协议下的 PCK。raw PCK@0.05 编辑器很低(Qwen 0.060),但 PA PCK@0.2 FireRed 达 0.795,接近 ViTPose 0.984 的结构。
说明 RGB 骨架预测能捕捉粗略姿态结构但绝对定位差,是理解「相对 vs 绝对」这一生成式局限的典型。
表对比监督接地专家(LAVT、UNINEXT、OneRef)与生成模型(Vision Banana、三编辑器)的 REC box Prec@0.5 与 RES cIoU/mIoU。Qwen REC 51.8、cIoU 40.3,仍低于 Vision Banana 73.8,但能在无接地头情况下完成自由文本到区域的定位。
证明编辑器已具备把语言与像素级接地连接起来的非平凡能力,是 RINO 语言理解维度的关键证据。
表对比 SAM 3(监督)、gDino-T、Vision Banana+Gemini 与三编辑器在 pmF1、IL_MCC、cgF1 上的结果。Qwen pmF1 39.8 尚可,但 IL_MCC 接近 0(FireRed 0.01、Qwen 0.04),导致 cgF1 极低,根源是编辑器不拒绝不存在的查询词。
这张表精确刻画「存在性检测缺失」这一关键弱点,为引入外部 MLLM 闸门等改进提供依据。
表对比训练型姿态生成模型(SD、T2I-Adapter、ControlNet、HumanSD、Stable-Pose 等)与三编辑器在 CAP/PCE/FID/KID/CLIP。FireRed CAP 68.09、FID 10.66、CLIP 34.24 与训练模型可比,LongCat FID 仅 7.91 但 CAP 偏低。
证明 RGB 骨架输入可作为空间生成条件,零样本即与任务训练的 ControlNet 类方法相当。
表对比 InstanceDiffusion 与三编辑器在 AP/AP50/AR/FID。LongCat AP 28.0、AR 44.2 超过训练版 InstanceDiffusion(AP 27.1、AR 38.1),Qwen/FireRed 也接近;AP50 训练参考仍领先,说明精确实例边界更难。
这是零样本编辑器在 AP/AR/FID 上全面反超任务训练基线的证据,凸显现代编辑骨干的强大。
图对比 GT Canny、GT、ControlNet、ControlNet++、Qwen 生成图及其重提取 Canny。Qwen 能大致遵循边缘但在精确边缘可控性、真实感与提示对齐上明显落后于训练控制器。
定性佐证 Table 15,直观展示二值边缘条件下的失败模式与差距。