2026 TPAMI | VIVNet:统一高效图像复原基线 (附代码)

2026 TPAMI | VIVNet:统一高效图像复原基线 (附代码) 1. 论文信息与代码链接项目内容题名Visual-in-Visual: A Unified and Efficient Baseline for Image Restoration作者Yuning CuiWenqi RenBoxin ShiAlois Knoll年份2026出处IEEE Transactions on Pattern Analysis and Machine IntelligenceDOI10.1109/tpami.2026.3669720链接https://doi.org/10.1109/tpami.2026.3669720代码https://github.com/c-yn/VIVNet2. 论文摘要本文提出VIVNet目标是在图像恢复中同时兼顾效果与效率。核心思路是将一个生物视觉启发的BIM嵌入U-shaped主干中在基础块内联合建模多尺度感知、相似性加权和高阶交互从而在较低计算开销下提升恢复表达能力。 作者在多种恢复场景中验证了该方法包括general、all-in-one、composite degradation、UHD以及医学图像、遥感、水下增强等域外任务。实验表明VIVNet 在多数设置下都能取得有竞争力甚至最优的结果同时保持较好的推理效率。3. 方法介绍VIVNet 的输入为退化图像I。首先通过3×3 卷积提取浅层特征再进入一个三尺度 U-shaped 编解码主干最终预测残差并与输入相加得到恢复结果。训练目标由空间域 Ls与频域 Lf组成L Ls 0.1Lf。图 1方法整体框架模型的核心单元是BIM每个基础块由BIM和FFN组成。1多尺度编码通过1×1 卷积配合3×3 / 9×9 深度可分离卷积在同一层内同时建模局部细节与更大范围上下文。2相似性加权将双路特征拼接后计算通道间的cosine similarity再经轻量MLP生成通道权重用于抑制冗余响应、突出更有效的特征。3高阶交互对两路加权特征进行逐元素乘法并与深度卷积反复交替迭代以建模更复杂的非线性依赖作者最终将交互阶数设为4。4整体上VIVNet 不依赖额外的多输入、多输出或显式退化提示而是在单一基础块内完成“看什么、压制什么、如何组合”的建模。4. 实验设置和结果评测覆盖PSNR、SSIM、LPIPS、RMSE并同时统计参数量、FLOPs和推理时间。涉及的数据集包括SRRS、Snow100K、DID-Data、SPA-Data、AGAN-Data、LOL-v2-s、DPDD、GoPro、SOTS-Indoor、Haze4k、Dense-Haze、NH-HAZE、LOLBlur、CDD-11、UHD-LL、UHD-Haze、4K-Rain13K、UHD-Blur、PolarStar M660、AAPM、IXI、Satehaze1k、LSUI等。场景数据集主要结果低光增强LOL-v2-s达到26.01 dB PSNR比MambaLLIE高0.14 dB比MambaIR高0.46 dB比Retinexformer高0.34 dB去模糊GoPro比EAMamba高0.1 dB参数少35%比MT-XL V2高0.44 dB去雾SOTS-Indoor比ConvIR-S高0.5 dB参数减半FLOPs降38%三任务统一恢复MoCE-IR平均PSNR提升0.18 dB其中去雾任务提升0.85 dB参数仅为其29%五任务统一恢复MoCE-IR-S / MoCE-IR平均比MoCE-IR-S高0.62 dB比MoCE-IR高0.12 dB参数减少71%分布外泛化DPDD / SRRS / AGAN-Data五任务模型在三项分布外任务上均优于两种强基线复合退化CDD-11平均比MoCE-IR-S高1.57 dBtiny版本仅用其8%参数遥感去雾Satehaze1k在薄雾和中雾上都比次优方法高0.87 dB重雾下比FMambaIR高0.4 dB水下增强LSUI达到29.09 dB PSNR比SS-UIE高0.22 dB医学图像PolarStar M660 / AAPM / IXIPET 合成达到37.19 dBCT 去噪优于DenoMamba且仅用其0.9%参数图 2五任务泛化评估表消融实验表明去掉SW和HP后基线只有31.40 dB加入SW提升3.37 dB加入HP提升3.01 dB两者同时使用效果最好。随着交互阶数继续增加收益逐渐变小因此最终采用4 阶配置编码阶段的卷积核选择9×9因为11×11在更高代价下反而掉点。效率方面VIVNet 在SRRS上比MT-L V2快15.48×在五任务设置下比MoCE-IR快2.65×在CDD-11上的tiny版本比MoCE-IR-S快7.70×同时在去雾类别上还能高0.34 dB。5. 结论这项工作把统一恢复和高效率放在同一个设计目标下通过BIM将多尺度感知、冗余抑制和高阶交互整合进轻量基础块中。它的优势不仅体现在单一任务上更体现在多退化统一恢复、复合退化、UHD、医学图像、遥感和水下增强等场景中的广泛适配性。论文同时也说明了边界面对极密集、细碎且与纹理高度相似的雨丝以及真实场景中缺少配对数据的重雾模型仍可能出现残留或过平滑问题。6. 可借鉴的思想1若要构建可迁移的恢复骨干可以优先把多尺度编码、冗余抑制、高阶交互统一到一个基础块中而不是单纯堆叠更重的注意力模块。2在需要兼顾速度与泛化的场景里可采用U-shaped主干承载共享表示再在基础块内加入轻量功能单元减少额外分支带来的开销。3多任务恢复不一定依赖显式退化先验可以让网络先从输入中学习退化差异再通过内部机制完成动态选择与恢复。4做恢复模型评估时应同时关注PSNR / SSIM与参数量 / FLOPs / 推理时间因为高分数并不一定对应更好的整体方案。