SWFNet:当脉冲神经网络遇见小波变换——VVC压缩360度视频质量增强的新范式

SWFNet:当脉冲神经网络遇见小波变换——VVC压缩360度视频质量增强的新范式

论文标题:SWFNet: A Spiking-Wavelet Fusion Network for Frame-Level Quality Enhancement of VVC-Compressed 360-Degree Video

发表期刊:IEEE Transactions on Circuits and Systems for Video Technology (TCSVT), 2026

DOI:10.1109/TCSVT.2026.3710288

开源代码:https://github.com/647-bei/SWFNet


一、研究背景:360度视频压缩的双重困境

1.1 VVC压缩与ERP投影的"双重失真"

360度全景视频是VR/AR沉浸式体验的核心载体。为了在有限带宽下传输这种超大视野的视频内容,业界采用了H.266/VVC(Versatile Video Coding)标准进行高压缩比编码。然而,激进的压缩策略不可避免地在解码端引入严重的压缩伪影。

更棘手的是,360度视频通常以**等距柱状投影(Equirectangular Projection, ERP)**格式存储和传输。ERP将球面经纬度线性映射到二维矩形平面,这一过程带来了一个固有的几何缺陷:两极区域被严重过采样。赤道附近的像素分布相对稀疏,而越接近极点,像素密度越高,大量冗余像素堆积在上下边缘区域。

这意味着当VVC对ERP图像进行均匀压缩时,两极区域的冗余像素不仅浪费编码码率,还会在解码后产生密集的块效应和振铃噪声。传统视频质量增强方法在处理这类图像时面临一个核心矛盾:如何在修正ERP几何畸变的同时恢复高频细节,且不超出严格的计算预算?

1.2 现有方法的局限

已有的压缩视频质量增强方法主要分为两类:

  • 基于CNN的方法(如NAFNet、ARCNN等):擅长局部纹理恢复,但缺乏全局结构建模能力,难以有效处理ERP特有的全局几何畸变。且参数量和计算量通常较大,难以扩展到4K/8K分辨率。
  • 基于Transformer的方法(如ViT系列):自注意力机制能捕获长距离依赖,有利于全局结构修正,但其O(N²)的计算复杂度在高分辨率输入下会迅速导致内存溢出(OOM),在8K分辨率下几乎不可行。

SWFNet的切入点正是这个"既要全局又要局部、既要质量又要效率"的三难困境。


二、核心思想:从灵长类视觉系统寻找灵感

2.1 大细胞-小细胞(M-P)双流理论

SWFNet的设计灵感来源于灵长类视觉系统中一条经过大量神经科学实验验证的经典通路——大细胞-小细胞(Magnocellular-Parvocellular, M-P)双流理论

在灵长类的外侧膝状体(LGN)中,视觉信息通过两条功能截然不同的并行通路进行处理:

特性大细胞通路(M-pathway)小细胞通路(P-pathway)
响应特性高时间频率、低空间频率高空间频率、低时间频率
功能侧重运动检测、全局结构感知精细纹理、颜色细节识别
传导速度快速、粗略较慢、精细
对比度敏感高对比度敏感低对比度敏感

M通路快速捕捉场景的全局结构和运动信息,提供"粗粒度但快速"的感知;P通路则慢速但精确地解析细节纹理。两条通路在视觉皮层汇合,共同构建完整的视觉感知。

2.2 从生物视觉到网络设计

SWFNet将这一生物机制映射为网络架构设计原则:

  • 全局流(M通路对应):采用脉冲神经网络(SNN)构建U-Net型架构,以事件驱动的稀疏脉冲捕获全局结构先验,修正ERP几何畸变。SNN的稀疏激活特性天然适配ERP两极区域的冗余采样问题——对过采样区域产生更少的脉冲响应,自适应地抑制冗余。
  • 局部流(P通路对应):采用残差小波融合模块(RWFB),在频域分解的多个尺度上恢复高频空间细节,补偿VVC量化造成的信息损失。

这种解耦设计将"几何修正"与"细节恢复"这两个本质上存在冲突的任务分配给不同通路独立处理,再通过融合机制协同输出,有效避免了单一网络同时处理两种任务时的互相干扰。


三、网络架构详解

SWFNet的整体架构是一个SNN-ANN混合双流网络,据论文称这是首次将混合脉冲-人工神经网络架构引入全景视频质量增强领域。

3.1 全局流:U型脉冲Transformer架构

全局流采用U-Net型编码器-解码器结构,核心组件包括:

(1)TransSNN模块(Transformer-SNN Block)

编码器端使用TransSNN模块提取全局结构先验。这一模块将Transformer的自注意力机制与脉冲神经元相结合:

  • 脉冲神经元:采用Leaky Integrate-and-Fire(LIF)模型。LIF神经元模拟生物神经元的膜电位累积-放电过程:输入信号累积到膜电位上,当电位超过阈值时发射脉冲(spike),随后膜电位重置。这一过程是离散的、事件驱动的——只有当输入足够强时才产生脉冲输出,天然实现了稀疏激活。
  • 稀疏自注意力:传统Transformer的自注意力对所有token对计算相似度,计算复杂度为O(N²)。TransSNN通过脉冲神经元的稀疏发放机制,使得只有显著的结构响应才能触发注意力计算,大幅减少了冗余计算。这类似于M通路中"只对显著全局变化做出快速响应"的特性。
(2)SCAtten模块(Spiking Channel Attention)

解码器端引入脉冲通道注意力机制。与传统ANN中的通道注意力(如SE-Net)不同,SCAtten在脉冲域中运行:

  • 通过脉冲驱动的全局平均池化压缩空间维度
  • 利用脉冲神经元的阈值机制自适应地选择重要通道
  • 主动抑制背景噪声和ERP过采样区域的冗余响应
(3)U-Net跳跃连接

编码器提取的多尺度全局特征通过跳跃连接传递给解码器,保留了不同分辨率下的结构信息。由于特征以脉冲形式传递,跳跃连接的内存开销极低。

(4)SNN在ERP场景的独特优势

ERP图像的两极区域存在大量冗余像素。传统ANN对所有像素执行相同的密集计算,在极区浪费大量算力。SNN的脉冲发放是输入驱动的——冗余、平坦区域的输入变化小,膜电位难以达到阈值,自然产生很少甚至零脉冲。这种自适应稀疏性使得SNN在处理ERP格式时具有天然的结构匹配优势。

3.2 局部流:残差小波融合模块(RWFB)

局部流专注于高频细节恢复,核心模块是残差小波融合块(Residual Wavelet Fusion Block, RWFB)

(1)为什么选择小波变换?

VVC压缩的本质是变换域的量化损失,其中高频分量受损最严重。传统CNN在空间域操作,难以显式地定位和恢复特定频段的损失。小波变换提供了一种多尺度频域分解工具:

  • 将特征分解为低频近似分量和高频细节分量(水平、垂直、对角线方向)
  • 不同频段可以独立处理,针对性地补偿量化损失
  • 小波变换是可逆的,分解后可以精确重建,不引入信息损失
(2)RWFB的工作流程

RWFB的处理流程可概括为:

  1. 小波分解:对输入特征进行离散小波变换(如Haar小波),得到一个低频子带和三个高频子带
  2. 频域自适应处理:对每个子带应用独立的卷积处理,低频子带保留全局结构,高频子带聚焦于细节恢复
  3. 残差融合:将处理后的子带通过逆小波变换重建特征,并与输入特征做残差连接
  4. 多尺度堆叠:多个RWFB级联,在不同分辨率尺度上逐步恢复细节

这种设计对应于P通路"精细解析高频空间细节"的生物特性,通过频域显式分解实现了对量化损失的精准补偿。

3.3 双流融合机制

全局流和局部流的输出通过融合机制汇合。论文中M-P双流理论强调两条通路在视觉皮层汇合后共同构建完整感知,SWFNet的融合模块同样需要:

  • 将全局流提供的结构先验(脉冲域稀疏表示)转换为连续值特征
  • 与局部流恢复的高频细节特征进行通道级融合
  • 通过可学习的融合权重自适应地平衡全局结构修正和局部细节恢复的贡献

四、效率优势:极轻量级的SOTA性能

SWFNet在效率方面的数据令人印象深刻:

指标SWFNetNAFNet(对比)
参数量1.48M~17M
计算量2.32 GFLOPs(论文GitHub)/ 10.3 GFLOPs(IEEE摘要)~268 GFLOPs
估算能耗44.8 mJ显著更高
峰值内存185.2 MB更高(8K下OOM)
8K推理可行OOM

注:GitHub README中标注为2.32 GFLOPs,而IEEE摘要中标注为10.3 GFLOPs,两者差异可能与是否计入脉冲运算的等效FLOP换算方式有关。核心结论一致:计算量比NAFNet降低约96%。

这种极端效率的来源有三:

  1. SNN的稀疏性:脉冲神经元只对显著输入发放脉冲,大量计算被跳过。在神经形态硬件上,这种稀疏性可直接转化为能耗节省(仅脉冲触发时消耗能量)。
  2. 小波变换的高效性:小波分解是一种固定变换,不需要学习参数,计算量远低于等价的深度卷积。
  3. 轻量架构设计:整体参数量仅1.48M,远小于主流恢复网络动辄数十M的规模。

8K可扩展性是SWFNet的一个独特卖点。由于SNN的稀疏激活和U-Net结构的内存效率,SWFNet是唯一能在8K(8192×4096)分辨率输入上进行可行推理的测试模型,而基于ViT的方法在此分辨率下普遍遭遇OOM。


五、实验结果分析

5.1 实验设置

基于论文信息,SWFNet的实验设置可归纳如下:

  • 任务:帧级质量增强(Frame-Level Quality Enhancement),即对VVC压缩后的360度视频帧进行后处理增强
  • 输入格式:ERP格式的4K和8K分辨率全景视频
  • 压缩标准:H.266/VVC
  • 数据集:360度视频质量评估数据集(具体数据集名称需参考论文正文)
  • 评估指标:PSNR、SSIM等全参考图像质量指标,以及WS-PSNR(Weighted-to-Spherical PSNR,专用于360度视频的球面加权PSNR)

5.2 核心结果

论文宣称SWFNet实现了state-of-the-art的恢复性能,同时在效率上远超对比方法。结合摘要和GitHub信息,关键发现包括:

  • 质量-效率权衡:在达到或超越现有SOTA方法恢复质量的同时,参数量减少至1.48M,计算量降低约96%
  • 8K可行性:在8K分辨率下成功完成推理,而对比方法(如NAFNet等基于密集ANN的方法)因OOM无法运行
  • 能耗优势:估算能耗44.8 mJ,为沉浸式高清媒体应用提供了有利的保真度-效率权衡

5.3 SNN在恢复任务中的有效性验证

论文的一个隐含贡献是验证了SNN在低级视觉任务(图像/视频恢复)中的可行性。传统上SNN主要用于分类等高级视觉任务,在需要精确数值预测的恢复任务中表现不佳。SWFNet通过SNN-ANN混合架构——用SNN处理全局结构(对数值精度要求较低的任务),用ANN处理局部细节恢复(需要精确数值预测的任务)——巧妙地规避了这一难题。


六、技术亮点与创新总结

6.1 四大核心创新

  1. 首个SNN-ANN混合架构用于全景视频质量增强:将脉冲神经网络的稀疏性能与人工神经网络的精确性结合,开辟了神经形态计算在视频恢复领域的新应用方向。

  2. M-P双流生物启发框架:将灵长类视觉系统的M-P双流理论映射为全局-局部解耦的网络设计,有效解决了ERP几何修正与细节恢复之间的冲突。

  3. TransSNN模块:创新性地将Transformer自注意力与脉冲神经元融合,在保持长距离建模能力的同时实现稀疏计算。

  4. RWFB模块:利用小波变换的多尺度频域分解,显式地针对VVC量化损失进行补偿,为压缩伪影去除提供了频域视角的解决方案。

6.2 方法论启示

SWFNet的设计思路对后续研究有几条重要启示:

  • 生物启发不等于简单模仿:SWFNet并非机械复制M-P通路,而是提取其"全局快速粗略+局部慢速精细"的功能分工原则,映射为SNN(稀疏、事件驱动)和ANN+小波(精确、频域)的技术组合。
  • SNN-ANN混合是务实路线:纯SNN在恢复任务中精度不足,纯ANN在高分辨率下效率不足。混合架构让两种范式各司其职,是一种务实的工程选择。
  • 频域处理对压缩伪影有天然优势:压缩伪影本质上是频域量化损失,在频域直接处理比在空间域间接学习更高效。

七、个人分析与思考

7.1 方法优势

  • 计算效率的质的飞跃:96%的计算量降低不是渐进式优化,而是架构层面的范式转换。对于需要在VR头显等功耗受限设备上实时运行的场景,这种效率提升具有实际部署价值。
  • 8K可扩展性:随着VR设备向8K演进,能在此分辨率上运行的质量增强方案具有前瞻性。
  • 理论动机扎实:M-P双流理论提供了清晰的功能分工依据,不是随意堆砌模块,而是有神经科学支撑的系统性设计。

7.2 潜在局限

  • 帧级处理的时序局限:SWFNet聚焦于帧级质量增强,未利用视频帧间的时序相关性。对于视频质量增强而言,多帧方法(如利用相邻高质量帧增强当前帧)通常能获得更好的性能。论文标题中的"Frame-Level"也暗示了这一范围限定。
  • SNN训练的工程挑战:脉冲神经元的不可导性需要使用替代梯度(Surrogate Gradient)进行反向传播训练,训练稳定性和收敛速度仍是SNN领域的共性难题。论文未详细讨论训练细节,实际复现可能面临调试困难。
  • 评估的全面性:从摘要和GitHub信息来看,主要评估了PSNR/SSIM等客观指标。对于360度视频,主观质量评估(如在VR头显中的用户研究)和球面一致性指标同样重要,论文是否覆盖这些维度有待确认。
  • GFLOPs数据不一致:GitHub README和IEEE摘要中GFLOPs数值存在差异(2.32 vs 10.3),可能涉及脉冲运算的等效计算量换算问题,建议关注论文正文的具体定义。
  • 代码尚未完全开源:GitHub仓库目前仅提供README和架构图,完整源代码将在论文正式接收后公开。在代码发布前,部分实现细节无法独立验证。

7.3 未来方向

基于SWFNet的思路,以下方向值得探索:

  1. 时序扩展:将帧级增强扩展为时序增强,利用SNN天然适合处理时序信号的特性,设计脉冲驱动的多帧质量增强框架。
  2. 神经形态硬件部署:在Loihi、天机芯等神经形态芯片上实际部署SWFNet,验证理论能耗优势能否在硬件上兑现。
  3. 自适应ERP处理:结合ERP的纬度依赖特性,设计纬度自适应的脉冲阈值或小波分解策略,进一步利用ERP的结构先验。
  4. 与其他压缩标准适配:将框架扩展到AV1、HEVC等其他压缩标准,验证方法的通用性。
  5. 端到端联合优化:探索将SWFNet作为VVC环路滤波器(In-Loop Filter)的替代方案,在编码端联合优化压缩效率与恢复质量。

八、总结

SWFNet提出了一种生物启发式的SNN-ANN混合架构,通过M-P双流理论将360度视频质量增强任务解耦为全局结构修正(脉冲Transformer)和局部细节恢复(小波融合)两条并行通路。在仅1.48M参数和极低计算量的条件下实现了SOTA恢复性能,并成为唯一可在8K分辨率上推理的方案。

这篇工作的核心贡献不在于单一模块的创新,而在于跨范式的系统设计——将神经科学的M-P理论、脉冲神经网络的稀疏计算、小波变换的频域分解三者有机融合,为高分辨率沉浸式视频质量增强提供了一条兼顾质量与效率的新路径。随着VR/AR设备向更高分辨率和更低功耗演进,这种生物启发的轻量架构思路具有重要的参考价值。


参考文献与资源

  • 论文链接:IEEE Xplore
  • 开源代码:GitHub - 647-bei/SWFNet
  • DOI:10.1109/TCSVT.2026.3710288