鲁棒且具3D感知的暗光 RGB-NIR 成像 Toward Robust and 3D-Aware RGB-NIR Imaging in the Dark
用3D神经隐式融合NIR与噪声RGB,无需干净RGB监督即可恢复暗光图像
前置知识
体渲染与神经辐射场 (NeRF)
神经辐射场用 MLP 把场景表示为连续 5D 函数 $F_\theta(x,d)\to(\sigma,c)$,其中 $\sigma$ 为体密度、$c$ 为颜色。沿相机射线采样多点,按 $C(r)=\sum_i T_i(1-\exp(-\sigma_i\delta_i))c_i$($T_i$ 为透射率)做体渲染得到像素。多视图体渲染天然施加 3D 一致性约束。
本文方法完全建立在体渲染框架之上:NIR MLP 预测密度 $\sigma$、RGB MLP 预测颜色,通过停梯度的隐式融合在 3D 空间聚合多视图信息去噪。不懂体渲染无法理解它为何能仅用噪声 RGB 就恢复出干净图像。
位置编码 (Positional Encoding)
位置编码用正弦/余弦基把低维坐标 $x$ 映射到高维 $\gamma(x)=[x,\sin(2^0\pi x),\cos(2^0\pi x),\ldots]$,使 MLP 能拟合高频细节。它隐含假设高频细节可能出现在任意位置 $x$,对干净数据有效,但会放大噪声中的高频成分。
本文核心发现之一是:在噪声 RGB 监督下,传统位置编码作用于 $(x,d)$ 会过拟合噪声、产生棋盘效应;改用对 NIR 估计 $c_N$ 编码才解决。理解位置编码的频率特性是读懂第 3.3 节的关键。
近红外 (NIR) 成像与 RGB-NIR 互补性
近红外 (Near-Infrared) 指波长约 700nm-1mm 的不可见光,常用 850nm LED 主动照明。NIR 在黑暗中提供稳定结构线索且不依赖环境光,但其强度图与 RGB 颜色无一一对应:同一 NIR 值可对应多种 RGB 颜色,即 NIR-to-RGB 歧义。
本文利用 NIR 在频域上与干净 RGB 相似的结构特性去引导噪声 RGB 恢复;同时必须解决 NIR-to-RGB 颜色歧义——这正是 Color Code MLP 的动机所在。
Gumbel-Softmax 重参数化
Gumbel-Softmax 把离散的 argmax 采样变为可微操作:$\delta=\text{one\_hot}\,\arg\max_i[g_i+\log\pi_i]$,其中 $g_i$ 采样自 Gumbel(0,1) 分布、$\pi_i$ 为类别对数概率,使梯度能通过离散选择反传。
Color Code MLP 用 Gumbel-Softmax 学一个 $K=16$ 类的颜色码分布,把每个 NIR 值映射为离散 one-hot 颜色码,从而绕开 MLP 平滑性导致的颜色混合伪影。不懂它就看不懂第 3.4 节的可微离散化。
研究动机
鲁棒暗光成像是计算机视觉的基础难题。极端低光下相机捕获的 RGB 充满散粒噪声与读出噪声,传统长曝光会带来运动模糊、连拍会带来可见性受限。现有 RGB-NIR 低光增强方法(SANet、NAID、DarkVisionNet 等)虽利用 NIR 在暗处可见且与 RGB 结构互补的特性显著优于纯 RGB 去噪,但都依赖精心配准的噪声 RGB–NIR–干净 RGB 三元组做监督学习:训练数据须从特定域采集,导致跨域泛化差、对噪声水平变化鲁棒性有限。例如在合成噪声 $s=1/200$ 的极端条件下,监督式 SANet 的 SSIM 从 $s=1/10$ 的 0.7556 暴跌到 0.1592,PSNR 从 17.52 跌到 13.64;LLNeRF 的 PSNR 更从 17.82 跌到 9.01。作者据此提出一个核心疑问:能否只用 NIR 与噪声 RGB、完全不用任何干净 RGB 监督,就实现鲁棒的暗光增强?
本文的目标是本文目标是在不依赖任何干净 RGB 监督的前提下,设计一个 3D 感知的 RGB-NIR 暗光成像模型:仅用 NIR 与噪声 RGB 的多视图观测,在 3D 空间隐式融合,恢复出干净 RGB 图像,并在不同噪声水平间保持鲁棒泛化。具体地,要构建多视图体渲染框架之上的全新神经隐式融合架构,引入两个针对 RGB-NIR 互补性的关键组件(NIR 调制的位置编码、Color Code MLP),并在自制的合成数据集 ROVER(Mitsuba3 渲染,5 场景,每场景 40 视图,分辨率 960×1280,5 个噪声档 $s\in\{1/10,1/25,1/50,1/100,1/200\}$)与真实采集数据集 SAKANA(JAI FS-3200T10GE-NNC 双通道相机,4 场景,49 视图,分辨率 768×1024,850nm LED 照明)上,证明其超过依赖干净监督的 SOTA,并在 RAW 域复现。
与已有工作不同的是,独特切入角度是把 3D 感知的神经隐式建模首次引入 RGB-NIR 暗光成像。此前多视图去噪(RawNeRF、LLNeRF)只用 RGB、未利用 NIR;引导去噪虽用 NIR 但全在 2D 像素空间配准融合,无法利用多视图一致性。作者的关键洞见是:NeRF 类 MLP 天然偏好平滑低频预测、体渲染天然施加多视图 3D 一致性——这两点恰是把噪声 RGB 清洗为干净 RGB 所需的强先验,再叠加 NIR 提供的结构引导,即可彻底摆脱对干净 RGB 监督的依赖。这与所有现有 2D 监督融合范式形成本质区别,作者还用两阶段 2D 融合+NeRF 基线反向证明 2D 融合因丢失多视图一致性而崩塌。
核心方法
直觉:既然 MLP 偏好低频、体渲染施加多视图一致性,那么在 3D 空间用 NIR 引导噪声 RGB,应能让模型从噪声监督中学到干净结构。技术路线分步累加:(1) 先用 vanilla NeRF 验证——它在噪声 RGB 上能减噪但引入棋盘伪影(Figure 4),说明 MLP+体渲染有效但需精心处理。(2) 设计并行结构:NIR MLP 预测密度 $\sigma$、RGB MLP 预测颜色,对 RGB 到 NIR 停梯度,几何重建改善但仍丢 2D 纹理。(3) 升级为 NIR 条件结构:把 NIR 输出喂入 RGB MLP(仍停梯度),同时改善 3D 结构与 2D 纹理。(4) 第 3.3 节解决位置编码:对 $c_N$ 做位置编码而非 $(x,d)$,实现频率对齐调制。(5) 第 3.4 节用 Color Code MLP 解决 NIR→RGB 颜色歧义。光度损失为 $\mathcal{L}_{photo}=\frac{1}{|\mathcal{R}|}\sum_r(\|c_N^r-\hat{c}_N^r\|_2+\phi\|c_R^r-\hat{c}_R^r\|_2)$,训练 200,000 步、Adam lr $5\times10^{-4}$、$\beta_1=0.9,\beta_2=0.999$,单卡 RTX 4090 约 3 小时、峰值显存 9GB。
核心创新是把 3D 神经隐式融合与两个 RGB-NIR 专属组件结合,彻底摆脱干净 RGB 监督。第一个组件是 NIR 调制位置编码:作者通过频域分析(Figure 8)量化发现噪声 RGB 的高低频能量比 $\rho_f=0.5261$,远高于干净 RGB 的 0.0101 与 NIR 的 0.0034,说明噪声主导了高频。传统位置编码作用于 $(x,d)$ 会无差别放大高频、过拟合噪声成棋盘效应;因干净 RGB 与 NIR 频域分布相似,作者改对 NIR 估计 $c_N$ 做位置编码:$c_R=\text{RGBMLP}(x,d,\gamma(c_N))$,这等于用 NIR 的结构频率做频率对齐调制,放大一致结构、抑制噪声高频。第二个组件是 Color Code MLP:解决一个 NIR 值对应多个 RGB 值的根本歧义(如猫头鹰眼睛 NIR 相同但 RGB 颜色不同),用 Gumbel-Softmax 学 $K=16$ 类颜色码分布,把歧义建模为离散概率而非确定性映射。两者叠加使模型无需任何干净 RGB 监督即超越依赖监督的 SOTA。
方法步骤详情
完整步骤分五步。Step 1 体渲染基座:保留标准 NeRF 体渲染公式不做改动,相机位姿用 COLMAP 标定,每场景 5 视图测试、其余训练。Step 2 NIR 条件隐式融合:NIR MLP 从 NIR 观测预测体密度 $\sigma$ 与 NIR 估计 $c_N$;RGB MLP 接收 $(x,d,\gamma(c_N))$ 预测颜色 $c_R$,对 RGB 到 NIR 的反向路径停梯度,确保 NIR 表示不被退化 RGB 污染(见 Figure 2(b)、3(b))。Step 3 NIR 调制位置编码:定义正弦位置编码 $\gamma(\cdot)$,按式 (1) $c_R=\text{RGBMLP}(x,d,\gamma(c_N))$,把 $(x,d)$ 直接送入、只对 $c_N$ 升维,实现频率对齐调制(见 Figure 7(b))。Step 4 Color Code MLP:对每个 $c_N$ 预测非均匀对数概率 $\pi$,按式 (2) $\delta=\text{one\_hot}\,\arg\max_i[g_i+\log\pi_i]$(Gumbel-Softmax 可微、$g_i\sim\text{Gumbel}(0,1)$、默认 $K=16$)得 one-hot 颜色码 $\delta$,再作为 RGB MLP 输入(见 Figure 5)。Step 5 优化:最小化 $\mathcal{L}_{photo}=\frac{1}{|\mathcal{R}|}\sum_r(\|c_N^r-\hat{c}_N^r\|_2+\phi\|c_R^r-\hat{c}_R^r\|_2)$,$\phi$ 为放大噪声 RGB 曝光的超参;200,000 步 Adam 优化。
技术新颖性
技术新颖性体现在四点。其一,首次把 3D 感知神经隐式建模引入 RGB-NIR 暗光成像:此前 NIR 引导去噪全在 2D 配准融合,作者证明只有让 MLP 在体渲染框架的 3D 空间隐式融合才能利用多视图一致性,并用两阶段 2D 融合+NeRF 基线(Table 3)反证 2D 融合因丢失多视图一致性而崩塌。其二,频域驱动的 NIR 调制位置编码:用 $\rho_f$ 能量比定量论证噪声高频问题,再巧妙复用 NIR 与干净 RGB 的频域相似性,把位置编码从空间坐标改到 NIR 值——这是对 NeRF 位置编码本质的重新思考。其三,Color Code MLP 用可微离散颜色码分布化解 NIR→RGB 的不适定映射,比确定性 MLP 的颜色混合伪影更合理。其四,方法论纪律性强:从 vanilla NeRF→并行结构→NIR 条件结构→加 NIR-P.E.→加 C.C. MLP 逐步累加,每步都有视觉与定量消融(Figure 11/12、Table 2/4)支撑,使每个组件的贡献可分离验证。
实验结果
核心发现分四块。(1) 合成数据 ROVER(Table 1):本文在全部 5 个噪声档 SSIM/PSNR/LPIPS 全面领先,最惊人之处是 PSNR 几乎不随噪声退化——$s=1/10$ 时 19.53,$s=1/200$ 时仍达 19.68,而 Restormer 从 17.60 跌到 14.43、SANet 从 17.52 跌到 13.64、LLNeRF 从 17.82 跌到 9.01。本文 SSIM 在 $s=1/200$ 仍保持 0.7028,第二好的 RawNeRF 仅 0.5157。(2) 两阶段基线对比(Table 3):2D 融合(NVEU/SANet/NAID)+NeRF 在 $s=1/200$ 时 PSNR 仅约 11.9-14.4,远低于本文 19.68,证明必须在 3D 空间联合融合而非先 2D 后 3D。(3) 真实数据 SAKANA(Table 6):PI 5.415、MUSIQ 56.51、MANIQA 0.2752、HSE 3.450 全面最优,MUSIQ 56.51 远超次优 NVEU 的 36.01。(4) RAW 域(Table 7):12-bit Bayer 线性归一化、不做白平衡,本文 PI 5.874、HSE 3.775 仍优于 RawNeRF(6.783/3.150)、NVEU、NAID,证明方法跨域泛化。(5) 消融(Table 2/4):去 NIR-P.E. 在 $s=1/200$ 的 LPIPS 从 0.2670 恶化到 0.3072 并现棋盘效应;去 C.C. MLP 出现颜色混合伪影,真实 HSE 从 3.450 降到 3.175。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 合成 ROVER 多视图暗光恢复(5 噪声档 SSIM/PSNR/LPIPS) | PSNR↑ / SSIM↑ / LPIPS↓ | s=1/10: 19.53/0.7572/0.2361;s=1/200: 19.68/0.7028/0.2670,PSNR 全程≈19.5-19.9 | Restormer 17.60→14.43;SANet 17.52→13.64;LLNeRF 17.82→9.01(PSNR 随噪声暴跌) | 极端 s=1/200 时 PSNR 领先 Restormer 5.25dB、领先 LLNeRF 10.67dB;SSIM 0.7028 远超次优 RawNeRF 的 0.5157 |
| 真实 SAKANA 暗光成像(4 场景 sRGB) | PI↓ / MUSIQ↑ / MANIQA↑ / HSE↑ | 5.415 / 56.51 / 0.2752 / 3.450 | 次优 NVEU 4.817/36.01/0.2639/3.025;Restormer 8.639/16.08/0.2333/2.550 | MUSIQ 56.51 较次优 36.01 提升 56.9%;HSE 3.450 较次优 3.025 提升 14%(无参考质量+人类主观双优) |
| RAW 域泛化(12-bit Bayer,无白平衡/颜色校正) | PI↓ / MUSIQ↑ / MANIQA↑ / HSE↑ | 5.874 / 55.70 / 0.2527 / 3.775 | RawNeRF 6.783/46.78/0.2251/3.150;NVEU 4.821/46.71/0.2482/2.850;NAID 9.924/34.76/0.2240/2.625 | HSE 3.775 较次优 RawNeRF 3.150 提升 19.8%,证明方法从 sRGB 泛化到 RAW 域 |
| 2D 融合 + NeRF 两阶段基线(合成 ROVER,s=1/200) | PSNR↑ / SSIM↑ / LPIPS↓ | 19.68 / 0.7028 / 0.2670 | NAID+NeRF 12.23/0.3619/0.8623;SANet+NeRF 14.42/0.5231/0.8674 | PSNR 领先 5-7dB,证明必须在 3D 空间联合融合而非先 2D 后 3D |
局限与改进
作者明确承认两点局限。第一,模型限于静态场景,无法处理动态环境,限制了手持拍摄或运动主体的实际应用。第二,当 RGB 与 NIR 来自两个完全不对齐的相机(如一台 RGB 相机加一台 NIR 相机自由采集)时,RGB 的相机位姿难以准确获取,方法难以适用——本文 SAKANA 用的是 JAI 双通道同轴相机,RGB/NIR 天然像素级对齐。此外我观察到额外限制:(a) 它本质是逐场景 NeRF 优化(200,000 步、约 3 小时每场景),不是单次前向去噪器,每个新场景都要重训,实时性与大规模部署成本远高于 Restormer 类 CNN;(b) 评估仅 5 合成加 4 真实场景,场景多样性偏少,对室外大尺度、高纹理复杂度场景未验证;(c) 强依赖 850nm NIR 主动 LED 照明,无 NIR 信号时方法失效;(d) 真实数据 MANIQA 0.2752 仅微弱领先 NAID 的 0.2732,在纯纹理感知指标上优势并非压倒性。
独立分析的弱点
独立分析五处弱点及对应改进方向。弱点一:逐场景优化、无法泛化到新场景,单次前向即出结果才能实用——改进方向是引入前馈 3D 融合网络(如多视图 Transformer 或前馈 3D Gaussian Splatting 变体),把隐式融合蒸馏为推理期一次前向。弱点二:强依赖 COLMAP 位姿标定与 RGB/NIR 像素级对齐,对自由双相机采集失效——改进方向是联合学习位姿估计与去噪,或用可微位姿细化(如 BARF)降低对 COLMAP 依赖。弱点三:仅静态场景,动态主体(手持拍摄、人物运动)无法处理——改进方向是引入动态 NeRF/4D 高斯或运动场,类似作者自己引用的 RS-NeRF、KFD-NeRF 动态建模工作。弱点四:场景多样性不足(5 合成加 4 真实),室外大尺度、高纹理复杂度未覆盖——改进方向是扩充更大多样性数据集并在自然暗光(无主动 LED)下评测。弱点五:训练成本偏高(3 小时每场景)且需 NIR 硬件,部署门槛高——改进方向是研究轻量化位置编码与蒸馏,降低训练步数与显存。
未来方向
作者明确提出的未来工作是处理动态场景,以及解决 RGB/NIR 完全不对齐时的位姿获取问题。基于本成果可延伸的方向包括:(1) 把 3D 神经隐式 RGB-NIR 融合推广到前馈架构,实现单次前向去噪以服务实时场景;(2) 联合位姿估计,去掉 COLMAP 依赖并支持自由双相机采集;(3) 与动态 NeRF 或 4D Gaussian Splatting 结合处理运动场景;(4) 把 Color Code MLP 的离散颜色码化解不适定映射思想推广到其他单通道到多通道的逆映射任务(如去马赛克、灰度上色);(5) 探索 NIR-P.E. 频率对齐调制在普通噪声 NeRF(无 NIR)中的退化形式,看能否用自监督结构先验替代 NIR;(6) 在自动驾驶夜间感知、安防监控、农业表型(作者获森林数字孪生与田间表型项目资助暗示此类应用方向)等真实管线落地评估;(7) 与 RAW 域 ISP 联合优化,端到端输出 sRGB。
复现评估
复现评估总体偏友好。有利因素:代码已开源 (https://github.com/MyNiuuu/3DarkFusion),且承诺数据将发布;关键超参齐全——训练 200,000 步、Adam lr $5\times10^{-4}$、$\beta_1=0.9,\beta_2=0.999$、$K=16$、单卡 RTX 4090 约 3 小时、峰值显存 9GB,算力门槛适中(单卡可跑);合成数据用开源 Mitsuba3 渲染,噪声按 Brooks et al. 的物理散粒加读出噪声合成,复现路径明确;基线(Restormer、RawNeRF、LLNeRF、SANet、NAID、NVEU)均有公开实现。不利因素:真实数据 SAKANA 需 JAI FS-3200T10GE-NNC 双通道相机加 850nm LED 硬件,普通研究者难采集;COLMAP 位姿标定与逐场景 200k 步训练带来工程量;正文未给出曝光超参 $\phi$ 的具体取值与网络层宽细节,需待代码补充。整体难度评估:合成实验单卡中等可复现,真实实验需专用 NIR 硬件偏难。
论文图表
上半部分展示方法核心设定:给定暗光下极噪的多视图 RGB 观测,用近红外恢复出干净 RGB 场景,优化时不使用任何干净 RGB。下半部分给出在合成数据集 ROVER 与真实采集数据集 SAKANA 两个场景上,本文相对各范式方法的视觉效果对比。
这是全文最重要的一张总览图,一图点明两个核心:训练时无干净 RGB 监督、跨合成与真实数据的视觉优势,是 grasping 整篇动机与成果的入口。