用于高效高保真表示的递归正弦隐式神经表示 Recurrent Sinusoidal INRs for Efficient High-Fidelity Representation
用共享正弦块递归展开替代加深网络,以更少参数和迭代实现高保真信号表示
前置知识
隐式神经表示(Implicit Neural Representation, INR)
隐式神经表示把一个连续信号(如图像、三维形状、辐射场)参数化为一个基于坐标的神经网络 $f: \mathbb{R}^d \rightarrow \mathbb{R}^c$,输入是空间坐标 $(x,y)$,输出是该坐标处的信号值(如 RGB)。由于网络定义在连续坐标上,可在任意位置采样和插值,是 3D 重建、新视角合成(NeRF)等任务的标准工具。本文把 INR 分解为编码器 $\mathcal{E}$(把低维坐标抬升到高维)、潜在变换 $\mathcal{F}$(细化特征)、解码器 $\mathcal{D}$(映射到输出)三段,并重点研究 $\mathcal{F}$ 的设计。
本文的全部讨论都建立在 INR 框架之上,理解坐标网络如何表示连续信号、为何需要谱偏置处理,是读懂递归细化改进的前提。
频谱偏置(Spectral Bias)
频谱偏置指神经网络倾向于先拟合低频结构、再拟合高频细节的现象,导致坐标 MLP 恢复精细细节困难。已有缓解手段包括改用正弦激活(SIREN)、傅里叶位置编码(NeRF 的 PE、随机傅里叶特征 RFF)、多分辨率网格/哈希编码等。这些方法要么扩大输入端频率内容,要么通过更深的潜在变换提升容量,但通常以增加模型规模或训练复杂度为代价。本文要解决的核心问题就是:能否在不增加独立参数化深度的情况下让 $\mathcal{F}$ 更擅长恢复高频。
频谱偏置是本文要攻克的核心难题,理解它才能理解为什么需要谐波频谱丰富化以及递归正弦为什么有效。
正弦激活网络(SIREN / FINER)
SIREN 用周期性正弦函数 $\sin(\cdot)$ 替换标准非线性,使坐标网络获得表示复杂信号的强能力;其第一层为 $\mathbf{h}_0(\mathbf{x}) = \sin(\omega_{in}\mathbf{W}_{in}\mathbf{x} + \mathbf{b}_{in})$,可视为一个可学习的傅里叶特征映射,$\omega_{in}$ 控制可用频带宽度。FINER 进一步调整正弦激活以覆盖更宽频率范围。本文方法(Harmonic-Siren)沿用正弦激活,但用权重共享的递归块替代逐层独立参数,从而在固定参数预算下迭代地丰富谐波谱。
本文方法以正弦激活为基础,且其有效性高度依赖正弦函数的谐波性质(非正弦递归反而会退化),理解 SIREN 是理解核心机制的前提。
权重共享递归展开(Weight-tied Recurrent Unrolling)
递归展开指把同一个共享模块重复应用 $T$ 步以增加有效深度,同时复用同一组参数,是一种参数高效的替代独立参数化深度的机制。本文的递归更新为 $\mathbf{h}^{(r)} = \sigma(W^{(rec)}(\mathbf{h}^{(r-1)}))$,其中 $W^{(rec)}$ 在所有 $R$ 步共享且无偏置。与之相关的平衡网络/DEQ(如 iSIREN)用不动点公式实现常数内存反传,但本文选择有限显式展开轨迹,以便观察每次共享变换如何改变潜在表示。
递归展开是本文方法的架构骨架,理解它与加深独立层的区别、与 DEQ/平衡网络的区别,是理解创新点的关键。
雅可比-安格尔恒等式与谐波线谱(Jacobi-Anger Identity / Harmonic Line Spectrum)
雅可比-安格尔恒等式把 $e^{i\sum_i k_i\theta_i}$ 展开,说明对多正弦输入再施加正弦非线性,会生成输入频率整数组合 $\Omega = \sum_i k_i \Omega_i$(含和频、差频、高阶谐波)处的新谱线,而非仅重加权已有谱线。这正是隐藏正弦层作为结构化谐波扩展的数学基础。本文据此论证:每多应用一次共享正弦块,就在理想意义上把可达频率支撑 $\Omega^{(\ell+1)} \subseteq \mathrm{span}_{\mathbb{Z}}(\Omega^{(\ell)})$ 进一步扩展。
这是本文理论分析的核心工具,理解它才能明白为什么递归正弦能在固定参数下不断丰富频谱、而非简单的'更深的网络'。
研究动机
隐式神经表示(INR)用坐标 MLP $f: \mathbb{R}^d \rightarrow \mathbb{R}^c$ 参数化连续信号,在 3D 重建与新视角合成中被广泛使用,但其核心瓶颈是频谱偏置:网络优先拟合低频结构,高频精细细节恢复困难。已有对策主要沿两条线推进——一是改造激活函数(SIREN 用正弦、FINER、Gauss、WIRE 等),二是用多频输入编码(NeRF 的位置编码、随机傅里叶特征、多分辨率哈希网格)。这些手段虽有效,却普遍靠增大模型规模、引入辅助参数或提高训练复杂度来换取保真度。在 INR 分解 $\mathbf{s} = \mathcal{D}(\mathcal{F}(\mathcal{E}(\mathbf{x})))$ 中,提升潜在变换 $\mathcal{F}$ 容量的常规做法是加深独立参数化层,但这会带来更多独立参数和计算。具体数据上,标准 INR 在 Kodak24 上 SIREN 训练 1000 步仅达 35.01 dB、WIRE 仅 26.83 dB,而达到接近无损的极高保真度(如 60+ dB)往往需要大量参数与上万次迭代。
本文的目标是本文的目标是在不增加独立参数化深度的前提下,让潜在变换 $\mathcal{F}$ 更擅长恢复精细结构,并用更少的参数与优化步数实现更高保真度的信号表示。具体而言,作者希望:(1)用同一个共享正弦块反复迭代地细化潜在表示,把'加深网络'替换为'重复使用同一参数块';(2)从频谱角度严格解释为什么这种递归有效——即每次共享变换如何丰富可达谐波支撑;(3)在固定参数预算下用更少迭代达到甚至超过独立深网络基线的保真度;(4)在 2D 图像拟合上做到可度量、甚至达到精确(PSNR=$\infty$)的量化重建,并把同一解码器迁移到超分辨率、NeRF、SDF 等连续表示任务。
与已有工作不同的是,已有递归/迭代 INR 工作主要走平衡网络(DEQ/不动点)路线,如 iSIREN,其动机是常数内存反传和摊销不动点求解,且不动点公式只在平衡态刻画潜在计算, successive 共享变换带来的逐步演化难以直接观察。本文的独特切入角度有三:第一,采用有限、显式展开的细化轨迹,使中间态可被频谱分析;第二,首次把正弦递归解释为'谐波线谱的迭代丰富化',用雅可比-安格尔恒等式证明隐藏正弦层在输入频率整数组合 $\Omega = \sum_i k_i \Omega_i$ 处生成新谱线;第三,把递归细化与双极化 Gray 编码监督相结合,在固定参数预算下实现精确量化重建。这区别于单纯加深独立层或仅追求内存高效的 DEQ 方法。
核心方法
方法直觉是:正弦激活天然诱导谐波线谱,每多施加一次共享正弦块,就在输入频率的整数组合处生成新高频谱线,从而在固定参数预算下迭代地丰富频谱。作者把 INR 分解为编码器 $\mathcal{E}$、潜在变换 $\mathcal{F}$、解码器 $\mathcal{D}$,用权重共享、无偏置的正弦块替代独立多层 $\mathcal{F}$:$f_\psi(\mathbf{x}) = W^{(out)} \circ (\sigma \circ W^{(rec)})^R \circ \sigma \circ W^{(in)}(\mathbf{x})$,$W^{(rec)}$ 在 $R$ 步递归中完全共享。为支持精确量化重建,在双极 Gray 编码空间用余弦相似度监督,$y_p$ 映射为 $\mathbf{c}_p = 2\Gamma(y_p)-1 \in \{-1,+1\}^B$,损失 $\mathcal{L}_{align}$ 为预测与目标的余弦相似度均值。解码用有界函数 $G(z) = z/\sqrt{1+z^2}$,阈值/符号算子仅推理时用。
核心创新是把正弦递归表述为谐波谱丰富化机制并给出谱解释。关键结果是:隐藏正弦层接收多正弦输入后,经雅可比-安格尔恒等式展开为 $\sin(u_j) = \sum_{\mathbf{k}} c_{j,\mathbf{k}}\sin(\beta_j + \sum_i k_i\theta_i)$,即在输入频率整数组合 $\Omega = \sum_i k_i \Omega_i$(含和频、差频、高阶谐波)处生成新谱线,而非仅重加权。这蕴含 $\Omega^{(\ell+1)} \subseteq \mathrm{span}_{\mathbb{Z}}(\Omega^{(\ell)})$,故递归能在固定参数下扩展有效谱支撑——这是与加深独立层或 DEQ 平衡态的本质区别。其次,递归偏置会在每次复用时引入相同相移并沿轨迹累积,因此采用无偏置递归层,在 $R\geq2$ 时带来巨大收益(Table 5:$R=5$ 时无偏置 90.28 dB vs 有偏置 78.10 dB)。
方法步骤详情
步骤 1(编码):$\mathbf{h}^{(0)} = \sigma(W^{(in)}(\mathbf{x}))$,$\sigma$ 为逐元素正弦,首层相当于可学习傅里叶特征、$\omega_{in}$ 控制带宽(取 $256/45$)。步骤 2(递归细化):$r=1,\dots,R$ 执行 $\mathbf{h}^{(r)} = \sigma(W^{(rec)}(\mathbf{h}^{(r-1)}))$,$W^{(rec)}$ 共享且无偏置,$R$ 默认 5。步骤 3(输出):$\hat{\mathbf{c}} = W^{(out)}(\mathbf{h}^{(R)})$ 再经有界解码 $G(z)=z/\sqrt{1+z^2}$。步骤 4(监督):$y_p$ 经 $B$ 位 Gray 编码并双极化为 $\mathbf{c}_p=2\Gamma(y_p)-1$,最小化余弦对齐损失,可选位平面加权优先高显著位。步骤 5(推理):仅推理时施加阈值/符号算子恢复精确 UINT8。优化用 AdamW、学习率 $1.5\times10^{-4}$、RTX 3090,基线仅调隐藏宽度对齐参数。
技术新颖性
技术新颖性体现在四点。其一,首次把权重共享的正弦细化形式化为 INR 的有限递归展开,用展开而非独立参数化层增加有效深度。其二,提供谐波线谱分析:用雅可比-安格尔恒等式严格证明隐藏正弦层生成输入频率整数组合处的新谱线 $\Omega = \sum_i k_i \Omega_i$,并据此定义谱支撑 $S^\tau_\ell$ 与上频带内容 $\mathrm{HF}_\ell$ 等度量,实证正弦递归逐步扩展谱支撑而非塌缩(Table 3)。其三,理论上揭示递归偏置会沿轨迹累积相移,提出无偏置递归层,实测 $R=5$ 时相比有偏置提升 $+12.18$ dB(Table 5)。其四,提出双极化 Gray 编码监督,结合 Gray 编码把最坏局部码空间敏感度从 $L^{local}_{NBC}=n/\delta$ 降到 $L^{local}_{GC}=1/\delta$(降低 $n$ 倍),并辅以解码感知的位平面加权,使固定预算下精确量化重建成为可能。此外还通过 Table 12 把递归细化与二值化监督的贡献解耦,证明递归是主要保真度来源。
实验结果
核心发现五点。第一,递归本身带来巨大增益:固定 593.7K 参数、500 步下,递归步数从 1 增到 5 使 PSNR 从 39.724 单调升到 63.378 dB(Table 2)。第二,主表(Table 6)显示本文仅 609K 参数、100 步即超过所有可学习频率基线 791K/1000 步结果:Set5 达 58.16 dB 对比 iSIREN 51.80、GaborNet 50.31;FFHQ-600 61.39 vs iSIREN 50.90。自适应迭代下四数据集均达 PSNR=$\infty$,平均分别 $322\pm117$、$447\pm327$、$537\pm432$、$440\pm350$ 步。第三,墙钟效率(Table 11):6.52 秒达 42.84 dB 已超最强基线 FINER(26.06 秒、40.08 dB)。第四,迁移性好:NeRF(Table 8)Flower LPIPS 0.4145→0.2934;SDF 比 SIREN 更细。第五,Gray 编码与位平面加权有效,如 RFF-F10 超分从 21.08 升到 23.98 dB。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 2D 图像拟合(Set5,1000 步 vs 本文 100 步) | PSNR ↑ | 58.16 dB(100 步,609K 参数);自适应达 ∞ | iSIREN 51.80 dB / GaborNet 50.31 dB / FINER 41.78 dB(1000 步,791K 参数) | 以更少参数、约 1/10 迭代超越全部可学习频率基线,并可达精确重建 |
| 2D 图像拟合(Kodak24) | PSNR ↑ / Bit err ↓ | 53.20 dB @100步,2.51K bit err;自适应 ∞ @447±327步 | iSIREN 52.67 dB(1000 步)/ FINER 42.15 dB | 100 步即接近 iSIREN 1000 步上限,且支持无损 |
| 墙钟效率(Kodak24) | 达到高保真的时间 | 6.52 秒达 42.84 dB;22.45 秒达 59.12 dB | FINER 26.06 秒达 40.08 dB(最强基线) | 用约 1/4 时间达到更高保真度 |
| 递归细化贡献解耦(Kodak24) | PSNR ↑ | +Rec.+Bin. ∞(609K,595±285步) | Feed-forward FINER 42.15 dB;+Rec. 64.19 dB | 递归带来约 +22 dB 主增益,二值化补齐剩余差距 |
| NeRF 新视角合成(LLFF 四场景) | PSNR/SSIM/LPIPS | Flower 24.54/0.7138/0.2934 | NeRF 23.71/0.6316/0.4145 | LPIPS 显著下降,几何感知更清晰 |
| 预训练任意尺度超分(Set5 ×2,约 50K 解码器) | PSNR/SSIM/LPIPS | 37.721/0.9489/0.0574 | LIIF MLP 37.673/0.9485/0.0625 | 解码器替换即一致提升,×2 感知增益最大 |
局限与改进
作者明确承认的局限是模型规模依赖:虽然在中到大参数预算下方法有益,但增益并非在所有模型规模上都一致出现,提示在极端容量约束下有效性可能受限(见第 8 节 Limitations)。从我个人观察补充三点:其一,方法的递归增益高度绑定正弦激活——Table 4 显示对 Gaussian 与 PEMLP(位置编码 MLP)递归反而退化(如 Gauss 从 60.31 dB 退到 12.02 dB),因此它不是通用递归技巧,仅适用于正弦家族;其二,精确重建(PSNR=$\infty$)只对量化/离散信号成立,对连续幅值的自然信号意义有限,且依赖 Gray 编码与位平面加权的特定监督设计;其三,递归展开增加每步前向计算,虽然墙钟效率更好,但单步计算开销随 $R$ 线性增长,在严格单步延迟受限场景下仍需权衡。
独立分析的弱点
第一个弱点是模型规模依赖。作者承认在极端容量约束下增益不稳定,我推测原因在于:共享单块在容量极小时,频率向量 $\Omega_i$ 数量不足,整数组合生成的谐波密度有限,递归的'谱丰富化'收益被抵消。改进方向是研究规模自适应的递归步数或组合多个不同尺度的共享块。第二个弱点是只对正弦激活有效。Table 4 证明非正弦递归(Gauss、PEMLP)频谱会塌缩,说明该方法与激活的周期性强耦合;改进方向是探索能保持整数组合闭包的其他周期/准周期核,或为非周期激活设计等价的谱丰富机制。第三个弱点是精确重建局限于量化信号。双极化 Gray 监督与位平面加权针对离散码空间,对连续回归任务(如连续 SDF、HDR)需要重新设计目标。改进方向是把码空间监督推广到连续表示(如软量化、可微码本)。第四个弱点是单步前向开销随 $R$ 增长,且需通过时间的反向传播(BPTT)训练。改进方向是结合 DEQ 的常数内存反传或隐式微分,兼顾递归深度与内存,或采用渐进式展开课程。
未来方向
作者提出的方向是理解并缓解模型规模依赖,把递归确立为'增加独立参数化深度'的简单、模块化替代。基于本文成果可延伸的方向包括:第一,将谐波线谱分析推广到其他周期激活(如复值正弦、Gabor 小波),研究更通用的'整数组合闭包'条件;第二,把递归正弦解码器作为即插即用模块集成到更多连续表示任务(3D 高斯泼溅、可微渲染、医学成像重建);第三,结合 DEQ/隐式微分以在保留递归谱丰富的同时获得常数内存训练,解决大 $R$ 下的 BPTT 内存问题;第四,把双极化 Gray 编码监督与位平面加权推广到其他需要精确离散恢复的信号(如点云属性、量化音频);第五,从理论上刻画'谱支撑扩展'与'过拟合/噪声放大'的权衡,为递归步数 $R$ 与参数规模提供选择准则。
复现评估
复现性总体较好。数据集均为公开标准基准(Set5、Kodak24、DIV2K、FFHQ、LLFF、Stanford Armadillo),预处理明确(DIV2K/FFHQ 各随机采样 100/600 张并缩放到 $256\times256$)。优化超参数完整给出:AdamW、学习率 $1.5\times10^{-4}$、无调度、默认 $R=5$、首/隐藏层频率尺度 $\omega_0=256/45$、硬件 NVIDIA RTX 3090;公平比较约定为保留基线宏架构、仅调隐藏宽度对齐参数量。作者提供了项目主页(hyeon-cho.github.io/Harmonic-line-Spectrum/),但论文正文未明确给出完整代码/权重开源链接与训练时长,精确重建所需的自适应迭代停止准则与位平面加权实现细节需进一步查证。谱度量 $S^\tau_\ell$、$\mathrm{HF}_\ell$ 的计算流程在公式中给出但需自行实现。综合看,主结果(图像拟合、NeRF、超分)在中等算力(单卡 RTX 3090)下可复现,难点在于精确重建阈值判定与跨任务解码器集成的工程细节。
论文图表
图展示高频误差可视化:每幅图是预测与真值高频分量之差 $|HP(\hat{I}) - HP(I_{GT})|$,其中 $HP(I) = I - \text{GaussianBlur}(I)$。从左到右改变正弦编码(式 4)的频率尺度 $\omega_{in} \in \{32,64,128,256\}$,对应可学习傅里叶特征嵌入的整体带宽。随 $\omega_{in}$ 增大,高频残差明显减小,说明首层频率尺度直接决定可用频带。
这张图直观证明了把首层正弦编码理解为可学习傅里叶特征的观点,并为 Table 1 的数值结果提供可视化证据,是理解'频率尺度如何影响保真度'的关键。
图含两部分:(a) MSE 误差曲线与 (b) 训练曲线,比较递归偏置启用(Bias ON)与禁用(Bias OFF)下的高频残差动力学与收敛行为。启用偏置时训练曲线更不稳定、高频残差波动更大。
这张图为'递归偏置会沿轨迹累积相移并损害多步递归'的理论分析提供实验佐证,是理解为何采用无偏置递归层的重要支撑。
表比较自然二进制编码(NBC)与 Gray 编码(GC)在 RFF-F10 与 Ours 上的拟合 PSNR 与超分 PSNR。Gray 编码一致提升,如 RFF-F10 超分从 21.08→23.98 dB,Ours 从 ∞(23.45) 提升到 26.55 dB,证明 Gray 编码改善训练分辨率拟合与未见坐标泛化。
该表验证 Gray 编码降低最坏局部码空间敏感度(从 $n/\delta$ 降到 $1/\delta$)的理论分析,是码空间监督设计的实验支撑。