← 返回 2026-07-24

基于相机-显示耦合的颜色透视 Color Pass-Through via Camera-Display Coupling

Ruikang Li, Molin Li, Jiarui Wu, Zhe Wei, Pengpeng Liu, Tianfan Xue 📅 2026-07-14 👍 20 2026-07-29 18:30
图像处理 相机-显示耦合 神经网络 计算摄影学 颜色复现

将手机摄像头与屏幕视为耦合系统,端到端学习校正以还原真实场景色彩

前置知识

ICC 色彩工作流

国际色彩联盟(ICC)制定的标准设备间色彩转换流程:先用相机标定将传感器测量映射到设备无关的中间空间(如 CIE XYZ),再用显示器标定把 XYZ 逆向映射回设备相关信号。整个过程被分解成两个独立标定阶段,靠低维的三通道中间表示桥接。

本文正是要打破这种“先各自标定再拼接”的范式,理解它的两阶段结构和信息瓶颈,才能明白作者为什么要提出端到端耦合系统。

同色异谱(相机异构性 / Metamerism)

不同的光谱辐射可能在相机的三通道响应下产生完全相同的 RGB 值(对相机来说是同一种颜色),但对人眼或其他观察者却是不同颜色。这是因为相机的光谱灵敏度曲线与人眼锥细胞响应不同,存在一个相机“看不见”但对人可见的频谱子空间(相机零空间 / metameric-black subspace)。

这是论文第二项核心创新“相机零空间颜色校正”的理论根源——残余色偏正是来自这个对相机不可见但对观察者可见的子空间,读懂它才能理解为什么需要额外补偿。

光谱灵敏度与伪逆投影

相机被建模为光谱灵敏度矩阵 $C \in \mathbb{R}^{3\times L}$(L 为采样波长数),显示器为主色矩阵 $D \in \mathbb{R}^{L\times 3}$。复合算子 $CD$ 把三维 RGB 编码再解码,其伪逆 $(CD)^{\dagger}$ 即“相机-显示投影器”,是一个幂等投影 $P_C = DF_CC$,满足 $P_C^2 = P_C$,能把任意辐射映射到保持相机颜色的相机异构体。

整个方法的数学基础就是伪逆投影和低秩分解,理解 $FC = (CD)^{\dagger}$、投影 $P_C$ 以及 PCA 秩-1 近似,才能跟上推导链条。

色彩恒常性与白平衡

摄影中假设同一物体在不同光照下感知颜色保持一致,由此衍生出估计并校正场景光照(白平衡)的任务。传统方法依赖手工假设,近年转向数据驱动估计光照;但三维 RGB 不足以描述高维光照,全局 $3\times 3$ 线性变换精度有限。

多光照自动白平衡是论文的重要对比基线,理解它只处理相机侧光照而忽略下游显示器复现,才能看出本文端到端方法的本质优势。

研究动机

当用手机拍摄真实场景并在屏幕上观看时,显示图像在颜色、亮度和对比度上往往与原始场景明显不同;这种差距即使现代传感器和高品质屏幕也未能消除。根本原因在于传统 ICC 工作流把高维的“捕获到显示”过程分解为两个分别标定的阶段:相机标定(场景辐射映射到 RGB 中间空间)和显示器标定(RGB 映射回发射辐射),再靠低维色彩变换连接。这种分解带来两个顽疾——其一是误差累积,两次标定误差叠加;其二是信息瓶颈,相机测量本质上是三维的,而真实辐射是高维的,标定本身无法克服这一固有瓶颈。现有的强力方法也力不从心:学习式多光源自动白平衡只能减少光照引起的色偏(Fig. 1 (b)),逐场景 ColorChecker 标定把图像映射到标准色彩空间(Fig. 1 (c)),它们都依赖受约束假设,无法在多样真实场景中为特定相机-显示对提供一致的复现保证。问题在沉浸式系统中更突出:VR 头显(如 Vision Pro)透视图在颜色对比度上可能明显偏离裸眼,AR 虚拟试穿镜也有类似保真度问题。

本文的目标是本文的目标是为特定的相机-显示对(如同一型号手机既作相机又作显示器)和特定观察者(人眼或其他三通道设备)实现“颜色透视”(color pass-through):屏幕显示的图像在观察者感知层面应尽可能接近原始真实场景。作者希望构建一个端到端可学习的校正框架,直接对捕获图像施加校正后显示,使显示辐射在观察者感知上复现场景颜色。注意这并非追求辐射级精确匹配——因为高维辐射无法用三维颜色精确重建(论文用秩论证证明 $DFC$ 的秩至多为 3,当 $L\gg 3$ 时不可能等于恒等)——而是追求感知层面的颜色等价,即对任意特定观察者 $M$,显示观察颜色 $Ms_i^*$ 应等于场景观察颜色 $Ms_i$。框架还应支持对每个特定观察者进行高效的一次性校准(只需一个 3 维系数 $\varphi$)。

与已有工作不同的是,本文的独特切入角度是打破“先各自标定再合成”的范式,直接把相机和显示器视为一个耦合的整体系统,用端到端可学习的神经投影器桥接二者。这与之前依赖固定中间色彩空间(CIE XYZ)和两次分离标定的方法形成本质区别——后者假设三维中间表示足以承载全部信息,而作者指出这正是不可行的信息瓶颈。更巧妙的是,作者没有停留在朴素的端到端学习,而是从理论上分析残余色偏根源——相机异构性,指出对相机不可见的频谱成分仍会影响观察者感知。基于严格推导得出残余误差完全位于相机的“异构黑空间”(metameric-black subspace),并利用自然光谱的低维性(第一主成分解释约 93% 方差),将其压缩为仅需一个 3 维校准系数 $\varphi \in \mathbb{R}^{3\times 1}$ 的简洁形式,使原本不可观测的高维校准问题变得实际可行。

核心方法

整体思路直觉上:与其分别调好相机和显示器再硬拼接,不如把“相机拍下→屏幕显示”整条链路当成一个黑箱,直接学一个校正函数 $F$ 让显示颜色对观察者来说和真实场景一致。技术路线分两步:第一步先考虑简化情形——让“观察者”就是相机本身(即另一台同型号手机),此时只需学一个“相机-显示投影器” $\hat{\mathcal{F}}_C$,它近似复合算子 $CD$ 的伪逆 $(CD)^\dagger$,能把捕获颜色逆映射回接近原始的颜色。数据通过“再捕获协议”获得:把数字图像渲染到屏幕上再用相机拍回来,形成像素对齐的 $(CD)\sigma_i \to \sigma_i$ 训练对。第二步,当观察者与相机不同(如人眼或 DSLR)时,单纯用 $\hat{\mathcal{F}}_C$ 会留下因相机异构性导致的残余色偏,作者通过理论推导将其归因于相机零空间,用一个轻量 CNN 预测每像素系数 $\hat{a}_i$,再结合对特定观察者一次性校准的 3 维系数 $\varphi$ 补偿。两个组件预训练后推理时端到端组合。整体用约 30.8K 参数即可完成 2K 图像的实时校正。

核心创新有两点。第一,提出“相机-显示投影”概念并证明它是幂等投影 $P_C = DF_CC$(满足 $P_C^2 = P_C$),能把任意场景辐射映射到一个保持相机颜色的相机异构体。这与传统 ICC 方法本质不同:后者强行把高维辐射塞进三维中间空间再解码,必然丢信息;本文直接学习非线性映射绕过瓶颈。第二,也是更深层的创新——“相机零空间颜色校正”。作者将场景辐射分解为相机可见成分 $r_i$ 和不可见成分 $n_i$($s_i = r_i + n_i$,$n_i \in \text{null}(C)$),严格推导出残余色偏 $\delta_i$ 完全来源于异构黑空间 $n_i$,且与可见成分无关($C(I-P_M)r_i = 0$)。基于自然光谱低维性(第一主成分解释约 93% 方差),用秩-1 近似 $n_i \approx a_i e$,使不可观测的高维问题降为只需校准 3 个参数的实际可行问题,这是把抽象理论落为工程的关键。

方法步骤详情

方法分五步。**步骤 1(估计主成分 $e$)**:用 ColorChecker 标定相机灵敏度 $C\in\mathbb{R}^{3\times L}$($L=31$),在高光谱数据上对相机零空间成分做 PCA 取主成分 $e$。**步骤 2(训练投影器 $\hat{\mathcal{F}}_C$)**:DIV2K 去噪版采样 RGB 监督 $\sigma_i$,渲染到显示器 $D$ 再用相机 $C$ 重拍得 $(CD)\sigma_i$,光流对齐后训练两层 MLP(隐藏 128,位置编码,绿通道加 AvgPool)最小化 $\|\sigma_i-\hat{\mathcal{F}}_C((CD)\sigma_i;\theta)\|$,800 训练/100 测试对。**步骤 3(训练零空间系数 $\hat{a}_i$)**:用 ARAD-1K/CAVE/ICVL(1000 训练/182 测试)模拟 $Cs_i$ 作输入、$a_i$ 作目标,谱重建 CNN 最小化 $\lambda_1\|\hat{s}_i-s_i\|_1+\lambda_2\|\hat{a}_i-a_i\|+\lambda_3\|\nabla\hat{a}_i-\nabla a_i\|$,取 $\lambda=(1,0.01,1)$。**步骤 4(校准 $\varphi$)**:对特定观察者在 ColorChecker 上对 $\varphi\in\mathbb{R}^{3\times1}$ 各分量于 $[0.025,0.075]$ 网格搜索(步长 0.0125)使误差最小。**步骤 5(推理)**:按 $\widehat{Ms_i^*}=MD\cdot\hat{\mathcal{F}}_C\cdot(Cs_i-\varphi(\hat{a}_i e))$ 一次前向得显示颜色。

技术新颖性

技术新颖性体现在多个层面:(1)首次将相机-显示耦合建模为端到端学习的非线性投影器,给出清晰数学基础(幂等投影、伪逆 $(CD)^\dagger$);(2)创新的“再捕获协议”数据采集方式,巧妙绕过商业显示器非线性(gamma、tone mapping)难以标定的问题,通过数据驱动隐式建模伪逆;(3)轻量架构设计——MLP+位置编码+绿通道 AvgPool,仅 30.8K 参数即可捕捉高频细节,超越 593K 参数的 IA-3DLUT;(4)最关键的理论贡献——从 Luther-Ives 条件出发推导出残余色偏完全位于相机零空间,并利用自然光谱低维性压缩为秩-1 形式,把原本需校准 $L$ 维的问题降到 3 个系数;(5)将“理想辐射透视”放松为“颜色透视”的目标重构,抓住感知本质而非物理精确,这是工程上的关键洞察。

颜色复现的方法与目标对比。(a)先前方法用固定色彩空间加两次分离标定;(b)本文针对单一特定观察者学习端到端投影器。
Fig. 2: 颜色复现的方法与目标对比。(a)先前方法用固定色彩空间加两次分离标定;(b)本文针对单一特定观察者学习端到端投影器。
Color Pass-Through 整体系统。(a)对应式 (11) 的完整颜色透视模型;(b)针对特定观察者 $M$ 的目标函数与评估准则。
Fig. 3: Color Pass-Through 整体系统。(a)对应式 (11) 的完整颜色透视模型;(b)针对特定观察者 $M$ 的目标函数与评估准则。
从再捕获数据学习 $F_C$。展示相机-显示投影器 $\hat{\mathcal{F}}_C$ 的模型训练与再捕获数据采集协议(a),以及模型的输入与目标(b)。
Fig. 4: 从再捕获数据学习 $F_C$。展示相机-显示投影器 $\hat{\mathcal{F}}_C$ 的模型训练与再捕获数据采集协议(a),以及模型的输入与目标(b)。
学习模型 $F_C(\cdot;\theta)$ 的有效性。对比 $3\times 4$ 仿射拟合(i)、带正则的 3D LUT(ii)、本文带位置编码与 AvgPool 的 MLP(iii)的可视化与误差图。
Fig. 5: 学习模型 $F_C(\cdot;\theta)$ 的有效性。对比 $3\times 4$ 仿射拟合(i)、带正则的 3D LUT(ii)、本文带位置编码与 AvgPool 的 MLP(iii)的可视化与误差图。
两个学习组件对颜色透视的有效性。(a)特殊情形:观察者为相机本身 $M:=C$;(b)常见情形:观察者异于相机 $M\neq C$,单独相机-显示投影不足,加上相机零空间校正后颜色一致。
Fig. 6: 两个学习组件对颜色透视的有效性。(a)特殊情形:观察者为相机本身 $M:=C$;(b)常见情形:观察者异于相机 $M\neq C$,单独相机-显示投影不足,加上相机零空间校正后颜色一致。
从高光谱数据学习相机零空间颜色系数 $a_i$。(a)用标定的 $C$ 与光谱数据集估计 $e$;(b)构造虚拟训练数据;(c)用 CNN 学习每像素相机零空间系数。
Fig. 7: 从高光谱数据学习相机零空间颜色系数 $a_i$。(a)用标定的 $C$ 与光谱数据集估计 $e$;(b)构造虚拟训练数据;(c)用 CNN 学习每像素相机零空间系数。

实验结果

核心发现:**(1)组件质量(Table 1)**:投影器 $\hat{\mathcal{F}}_C$ 仅 30.8K 参数、2K 输入 41.30ms(RTX 4090),PSNR 32.13、$\Delta E_{mean}$ 3.34,超 IA-3DLUT(593K 参数,26.69)、NiLUT(31.03)、CSRNet(31.12);$\hat{a}_i$ 在 $(1,0.01,1)$ 配置 PSNR 29.68(加谱重建监督从 28.27 明显提升)。**(2)整体透视(Table 2,24 色 ColorChecker,10 色温 2500–9000K + 5 种 RGB-LED)**:本文华为 28.65/5.18/17.48、小米 29.10/4.79/16.12(PSNR/ΔE/STRESS);较默认相机(13.78/14.62/26.23)PSNR 约提升 2 倍,较 ColorChecker 标定(15.02/18.49/38.85)与多光照自动白平衡(12.84/17.84/31.12)显著领先;不加零空间校正(27.32/6.49/17.27)已大幅领先,校正再带来约 1.3 dB 增益。**(3)用户研究(Fig. 10,10 人 10 场景 5 分 Likert)**:颜色准确度均分 4.32/4.03,远超默认相机 1.90/2.07、ColorChecker 1.66/1.90、自动白平衡 2.06/1.84,约 +2.0 分。**(4)Fig. 11**:DSLR 代理观察者与人类趋势一致但更严格。**(5)Fig. 12、13**:$\varphi$ 跨场景稳定,$\hat{\mathcal{F}}_C$ 仅 100 张训练即接近效果。

评估相机-显示投影器 $F_C$ 与相机零空间系数 $\hat{a}_i$ 的学习模型性能,含 PSNR、ΔE、STRESS 及 2K 输入在 RTX 4090 上的运行时间。
Table 1: 评估相机-显示投影器 $F_C$ 与相机零空间系数 $\hat{a}_i$ 的学习模型性能,含 PSNR、ΔE、STRESS 及 2K 输入在 RTX 4090 上的运行时间。
在未见过的多种光照下,用 24 色 ColorChecker 色块对颜色透视的定量对比;灰括号内为亮度对齐到本文方法后的结果,本文仍最佳。
Table 2: 在未见过的多种光照下,用 24 色 ColorChecker 色块对颜色透视的定量对比;灰括号内为亮度对齐到本文方法后的结果,本文仍最佳。
分离视图对比。前三列经手机屏观察的图像,最右列直接观察真实场景。
Fig. 8: 分离视图对比。前三列经手机屏观察的图像,最右列直接观察真实场景。
场景内直接对比。每列展示一块悬浮于真实场景之上、显示处理后图像的手机屏。
Fig. 9: 场景内直接对比。每列展示一块悬浮于真实场景之上、显示处理后图像的手机屏。
关于亮度和颜色准确度的用户研究。参与者在 5 分 Likert 量表上对与参考的相似度打分(1 最不相似,5 最相似)。
Fig. 10: 关于亮度和颜色准确度的用户研究。参与者在 5 分 Likert 量表上对与参考的相似度打分(1 最不相似,5 最相似)。
DSLR 与人类被试评估之间的偏好对比。
Fig. 11: DSLR 与人类被试评估之间的偏好对比。
$F_C$ 的学习效率。
Fig. 12: $F_C$ 的学习效率。
校准系数 $\varphi$ 的鲁棒性。
Fig. 13: 校准系数 $\varphi$ 的鲁棒性。
查看结构化数据
任务指标本文基线提升
24 色 ColorChecker 颜色透视(华为) PSNR ↑ 28.65 dB 默认手机相机 13.78 dB +107%(约 2 倍)
24 色 ColorChecker 颜色透视(小米) PSNR ↑ 29.10 dB 默认手机相机 14.61 dB +99%(约 2 倍)
24 色 ColorChecker 颜色透视(华为) ΔE_mean ↓ 5.18 默认手机相机 14.62 误差降低约 65%
相机-显示投影器拟合质量 PSNR ↑ 32.13 dB(30.8K 参数) IA-3DLUT 26.69 dB(593K 参数) +5.44 dB,参数量仅约 1/19
用户研究颜色准确度 5 分 Likert 评分 4.32(华为) 默认相机 1.90 +2.42 分

局限与改进

作者承认的局限:(1)方法假设相机零空间成分 $n_i$ 低维(秩-1 近似),第一主成分约解释 93% 方差,仍有约 7% 未建模,极端光谱场景下可能失效;(2)每个相机-显示对都需单独学习,校准系数 $\varphi$ 是观察者特定的,换设备或换人需重新校准;(3)DSLR 作代理观察者虽与人类趋势一致但并不等同人眼,定量结果不完全等于感知质量;(4)再捕获协议依赖物理设备的稳定摆放和精准对齐。我自己的观察:(1)校准 $\varphi$ 仍需 ColorChecker 和人工参与,未实现全自动;(2)绿通道 AvgPool 这一经验预处理缺乏理论解释,可能对其他传感器不鲁棒;(3)实验仅用两款特定高端手机,对廉价屏或老化的 OLED 的泛化未验证;(4)未考虑环境光、观看角度等动态因素对屏幕有效颜色的影响;(5)秩-1 近似在多窄带 LED 混合光照下的精度未充分验证。

独立分析的弱点

独立分析的弱点及改进方向。**(1)校准非自动化**——$\varphi$ 需 24 色 ColorChecker 加网格搜索,对普通用户不友好;改进:用日常场景的已知中性色(灰卡、白墙)无监督估计 $\varphi$,或用元学习快速适配新设备。**(2)秩-1 近似精度上限**——93% 方差仍有空间;改进:自适应选 $K$(低维 $K=1$,复杂光谱 $K=2\sim3$)或用学习式而非固定 PCA 基。**(3)观察者模型固定**——$\varphi$ 无法适配个体视觉差异(如色觉异常);改进:引入个体锥细胞响应模型参数化推导。**(4)设备覆盖有限**——仅验证华为 Pura 70 Pro 和小米 17 Pro Max,未覆盖动机反复提到的 VR/AR 透视;改进:扩展到 Vision Pro 等设备。**(5)动态环境鲁棒性**——环境光改变屏幕有效颜色,论文未处理;改进:加环境光感知闭环校正。**(6)绿通道 AvgPool 经验性**;改进:用可学习的 demosaic-aware 模块替代。

未来方向

作者提出的方向:(1)将方法扩展到沉浸式系统(VR/AR 透视),这正是引言强调的动机场景(Vision Pro 透视色偏、AR 虚拟试穿),但实验尚未覆盖;(2)硬件驱动方案——通过特殊设计的相机滤光片满足 Luther-Ives 条件 $\text{null}(C)\subseteq\text{null}(M)$ 强制 $\delta_i=0$,从根本上消除残余色偏;(3)简化或自动化 $\varphi$ 校准流程。基于成果可延伸的方向:(1)将端到端耦合思想推广到其他“传感-显示”链路,如专业摄影的相机-打印、相机-投影仪;(2)结合神经辐射场或可微分渲染,学习更精细的光谱感知模型;(3)探索跨设备联邦学习,让多台手机共享投影器知识,降低每台单独训练成本;(4)与时域处理结合,处理视频透视中的闪烁和时序一致性;(5)用本方法的高保真色彩复现辅助色彩科学基础研究(如研究异构色现象)。

复现评估

复现评估:**开源**——提供项目主页 https://lyricccco.github.io/color-pass-through/ ,但未明确代码权重是否开源。**数据**——DIV2K(去噪版)和高光谱数据集(ARAD-1K、CAVE、ICVL,$L=31$)均为公开数据;但“再捕获数据”需自建装置。**硬件依赖(最大障碍)**——需两台同型号手机(华为 Pura 70 Pro 或小米 17 Pro Max)、一台 DSLR(Sony ILCE-7M4)、Ulanzi VL49RGB 光源,物理摆放与对齐难精确复现。**算法细节**——架构(MLP 两层宽 128 + 位置编码、谱重建 CNN)、损失权重 $\lambda=(1,0.01,1)$、训练规模($\hat{\mathcal{F}}_C$:800/100 对;$\hat{a}_i$:1000/182)均已交代。**算力**——推理 RTX 4090 上 2K 图 41.30ms,训练规模小、单 GPU 可完成。**复现难度**——中偏高,算法可复现,但物理采集与设备标定依赖特定硬件,端到端复现较困难。