TPAMI 2026 | DiTFuse:交互式图像融合 + 语义分割,一句话就能控制多任务融合? 📅 发布时间:2026/8/30 7:11:07 👁 浏览次数: TPAMI 2026 可控图像融合和语义分割一个指令就可以实现融合吗DiTFuse使用Diffusion Transformer来统一地进行融合、控制以及下游的任务本文所研究的问题也越来越重要了并不是简单的将两张图片合成为一个新的图片而是要能够对这两张图片进行分析用户想要什么。作者提出DiTFuse把红外和可见光的结合把多聚焦融合、多曝光融合、文本可控增强和指令式的语义分割都放在一个体系中来考虑问题。扩散变压器在同一潜空间里同时建立图像、文字模型并且使自然语言参与到融合的过程中去。图1 三种方式对比pre-fusion、post-fusion和基于DiT的方法。图2 表明DiTFuse除了具有任务特定或者全集成的方法所具有的文本控制以及指令驱动分割的能力之外还增加了其他的特性。01 论文信息英文题目Towards Unified Semantic and Controllable Image Fusion: A Diffusion Transformer Approach中文题目迈向统一语义与可控图像融合一种扩散 Transformer 方法作者Jiayang Li*、Chengjie Jiang*、Junjun Jiang†、Pengwei Liang、Jiayi Ma、Liqiang Nie单位哈尔滨工业大学清华大学深圳国际研究生院武汉大学哈尔滨工业大学深圳发表IEEE TPAMI 2026**DOI10.1109/TPAMI.2025.3642842代码https://github.com/Henry-Lee-real/DiTFuse02 方法就是使文本参与到融合当中去DiTFuse 并不等同于对融合的结果进行二次加工在此基础上进行修改而是在融合之后再做处理并行多模态输入文本指令以及两个原始图片一起被送入到DiT中在扩散生成的过程中两者会一起确定要保留的内容、加强的部分以及要强调的意义。与先融合后控制不同的是这样的方式更加符合实际情况。指令驱动融合整个过程可以分为三个步骤来完成第一部分是把文本用Phi-3分词器分成多个词语第二部分是把这些词语输入到一个模型中去得到结果第三部分就是根据这个结果进行相应的操作。语义 token第二步就是把两个源图通过VAE编码成潜空间。第三步是把文本token、图片token、噪声token以及时间戳信息一起输入到DiT中在多层Transformer的帮助下完成跨模态的信息交流之后再用VAE解码器把潜在变量转换成带有分割或者合成效果的图片。图3为DiTFuse的主要结构图在训练的时候使用M3等任务来对模型进行约束在推理的时候可以实现IVIF、MFF、MEF、语义分割以及文本控制融合。① 文本编码就是把自然语言转化为包含条件的输入为什么用户的提示可以是增加亮度、强调红外目标或者把人区分开来等。• 怎么处理首先用Phi-3分词器把句子分成一个个单词然后用Transformer编码器抽取其中的意义信息。起的作用是什么把原来的后处理提示改成直接的融合条件参与生成。② 视觉编码就是把图像压缩到一个共同的空间里输入为什么红外图、可见光图和MFF/MEF中的多源图像。• 怎么处理首先用VAE编码器把图片映射到低维度的潜在空间中去然后变成视觉标记。重要的原因是什么于是图像token和文本token就可以一起放到一个序列里进行建模了从而达到真正的图文协同融合。③ DiT 交互就是在生成的时候就做融合决策• 交互方式文本token、图片token、噪声token以及时间步的信息一起被送入到DiffusionTransformer中去。• 核心能力随着模型逐渐去除噪声在确定了哪些地方应该用红外来表示而哪些地方则要保持可见光纹理之后。• 最大特点融合的结果并不是一个固定的模式而是一个不断变化的过程它会根据实际情况来改变文本意图动态变化。④ LoRA微调保持大模型的能力的同时减少训练的成本为什么要用全部数据进行训练呢DiT 的参数很多直接进行训练的成本很高并且会破坏掉预训练所获得的能力。论文怎么写给 Transformer block 的线性层加上 LoRA并且只对低秩增量参数进行学习。带来的好处有同时又保持了预训练模型生成先验并且可以适配IVIF、MFF、MEF、文本控制以及语义分割等。⑤ 解码输出同一个结构可以产生出不同的任务的结果• 基础融合产生出红外和可见光、多焦距或者多次曝光相融合的效果图。• 可控融合按照提示来改变亮度、细节以及红外目标明显程度等视觉上的喜好。• 语义分割按照给定的目标类别来直接得到分段的结果完成融合与理解统一。注意机制也进行了相应的改进对于文本序列使用的是因果注意力而对于图像内部则用到了双向注意力在此之下每一个像素点都可以看到整个图片的内容并且随着文本指令的发展而不断改变。图像内容文本意图扩散生成过程共同决定。03 M3 扩大的融合监督训练融合任务最大的问题是没有合适的 GT。DiTFuse 采用的方法是多降解口罩图像建模M3解决的方法是以自然界中的图片为起点创建一对互补退化的图形单位使模型在两个不完整的、不准确的输入之间去重构出一个完整的图像。这就迫使模型学会了如何从两幅残缺且模糊的照片里还原出一幅完整的照片。对齐、选取以及补齐。图4 为训练数据生成过程示意图。图5为用作训练的数据所形成的sunburst图其中包含了M3、Seg、Control和Fusion四种类型的数据。M3 的训练方法可以这样来解释• 构造输入以自然界中的图片为基础产生出两幅互相补充并且有所退化的图象来其中一幅缺少了某些部分或者细节另一幅则缺少另外一些部分或者细节。• 学习目标模型要从两幅退化的图片里把完整的物体图样给找出来并且还要学会利用不同图片之间的互补信息。对融合有好处的是这就使模型具有了天然的能力区域选择、内容补全和跨模态互补能力。论文里所用的数据集大小是316,392其中真实的融合数据所占比重很小4.3%DiTFuse 并不是靠一个巨大的语言模型来实现的而是通过使用M3以及各种各样的任务指令数据把少量的数据进行扩充并且把这些数据当作可以被学习到的一个整体监督信号来进行处理。04 实验统一、并行、受控实验涉及八个数据集IVIF 使用MSRS、M3FD、TNO、RoadScene、LLVIPMFF用的是MFF和RealMFFMEF用的是SICE训练参数是8个A100批次大小为64学习率为1e-05。-4进行两轮的训练之后使用rank为64的LoRA。图7 为IVIF定性的比较结果在过曝、雾天以及低光照条件下都表现良好。DiTFuse在抑制过曝、凸显人车轮廓、保留下红外线纹等方面更加可靠。用定量的方式把DiTFuse在各种红外-可见光融合的标准上所取得的成绩都展现出来。MFF、RealMFF 和 SICE 的结果表明DiTFuse 并不是只进行IVIF的工作而是一起完成各种融合的任务。05 可控融合和语义分割DiTFuse 最有趣的一点就是它可以按照文本指令改变融合的结果。比如用户可以提出“增加亮度”、“多保留一些红外目标”、“提高分辨率”的要求模型就会在同一个输入数据集里得到不同的融合效果。再进一步的话它可以按照命令给出目标区段的语义分割图也就是把低层融合和高层理解放到一条生成链路上去。在不同的提示下同一个输入会得到不同的融合结果这就证明了用户的意图是可以被改变来影响融合过程的。模型可以按照给定的类别或者目标区域对多模态输入进行分割并且得到分割的结果在此过程中实现了融合以及下游任务的一体化。06 消融与泛化消融实验主要是为了检验出训练方法以及各种不同类型的数据所起的作用。M3完成像素级别的对齐和修复工作Seg 数据增强语义理解控制数据使模型能够给出稳定的回答来回应各种各样的指令并且该研究也证明了它的零样本泛化的能力在没有事先准备好的情况下也可以用互补的信息去恢复出结果。消融的结果表明M3、Seg、Control的数据和多任务联合训练在不同的层面上都对最后的效果产生了影响。图20为随机遮挡图像恢复的例子可以发现该模型可以通过互补的信息来进行内容感知式的重构并且展示了DiT生成式融合所具有的通用性。07 一句话总结DiTFuse 不仅是将 DiT 应用于图像融合之中而且更进一步地将 DiT 应用于其他领域统一融合、文本控制和语义分割放入同一个生成式的体系中当用户给出一个句子的时候该模型就可以判断出要怎样去改变它的结果了。往期推荐