ICML 2026|DRFusion:用稳定历史引导实现抗漂移红外-可见光视频融合
1. 用一句话来概括就是
对于红外-可见光视频逐帧融合会出现闪烁、光流对齐会出重影、自回归扩散模型会积累误差等问题,本文提出了DR Fusion,把视频融合起来再做一次建模,使历史条件下产生的运动的过程和融合的质量、时间序列稳定性以及目标跟踪的效果都得到了较好的兼顾。
图1. 不同视频融合方法的融合质量与时序稳定性对比。
2. 论文信息
英文题目:DRFusion: Drift-Resilient Temporally Consistent Infrared–Visible Video Fusion
中文题目:DRFusion:抗漂移、时序一致的红外-可见光视频融合
发表:ICML 2026
作者:Xingyuan Li、Haoyuan Xu、Shulin Li、Xiang Chen、Zhiying Jiang、Jinyuan Liu*
作者单位:
浙江大学计算机科学与技术学院
大连理工大学软件学院、大连理工大学—立命馆大学国际信息与软件学院
大连海事大学信息科学技术学院
代码:https://github.com/xhhaoyan/DRFusion
下载:https://arxiv.org/abs/2605.25775
3. 论文摘要
逐帧图像融合不考虑相邻帧之间的联系,会使得亮度、纹理以及目标边沿出现随着时间变化而变化的情况。
光流法用刚性的变形来约束相邻帧,在快速移动、遮挡或者估计算法出错的时候会产生重影和结构失真的问题。
DRFusion 用三维扩散变压器来建模视频中的运动,并且利用红外结构条件来控制内容的融合。
稳定的历法可以将时间的一致性转换为频率滤波的问题,从而保留低频的趋势而抑制高频的波动以及由于误差积累所造成的干扰。
4. 核心创新点
创新一:历史条件运行产生
论文不把视频看作一组独立的图片,而是在前向过程中学习到当前帧所处的历史背景下的生成概率,并且用三维狄特隐式的运动模型来代替光流硬对齐的方法,在推理的时候也不需要使用光流算法。
创新二:稳定的史实来引导
作者创建了各种各样的历史情景,并且给历史潜变量添加了噪音来对其进行干扰。少量的噪音在频域里就相当于一个软低通滤波器,在保持稳定运动趋势的同时也消除了闪烁以及累积伪影。
创新三:解耦式的结构、运动适配
分两步来完成任务:第一步是让模型去学习时间上连续的空间表示;第二步则是固定住三维狄特的部分参数,并且只对条件适配器进行微调,在此过程中把热目标的结构加入到生成的过程中去。
5. 方法详解
5.1 整个结构
给出一个红外视频序列
与可见光视频序列
模型生成出融合视频
DRFusion 主要包含以下三个主要部分:
时序约束的VAE可以得到稳定的潜在空间;
Condition Adapter 将红外结构注入到冻结的三维数字图像中去;
推理的时候用稳定的历法来引导、用潜变量去细化,从而提高时间上的确定性和目的上的明确性。
图2 此图为两阶段训练、红外环境适应、三维-深度图像视频生成、历史帧指引以及潜在变量精炼的过程。
5.2 时序约束所占的空间
第一种方法是用光流做为软正则,在潜在空间里对相邻帧进行限制:
其中,
表示潜变量,
表示光流,
表示变形操作,
表示遮挡掩码。
**公式解读:**模型只对不可见的部分进行限制,在相邻帧之间产生潜在变量,并且使得潜在空间具有时间上的连贯性。光流只起着一个监督的作用,并没有参与到最终视频的硬对齐中去。
5.3 红外结构指引
第二步是冻结3D-DiT的前向部分,并且只对Condition Adapter进行训练:
其中,
为了满足红外的要求,
它是可以看见的光潜变量。
公式解读:可见光潜变量起着背景纹理的作用,红外条件则把热目标的特点表现出来,冻结的三维数字图像用来维持运动中的画面。
5.4 稳定的历史指引
论文提出了三种历史背景:
:用高斯白噪声代替历史帧做为没有历史基础的数据;
:完整的历添加一些噪音来保持稳定的运动趋势;
:只保留最新的那一帧,并且要对相邻两帧之间的差别进行说明。
最后的速度预估是:
其中,
为引导尺度,
3D-DiT 预测生成的速度。
公式解读:用来抽取不容易被局部闪烁所干扰的长时间的趋势变化,以此来减小自回归误差不断增大。
用一句话来概括这个方法就是:DRFusion 通过使用红外结构来控制视频扩散模型,并且从中抽取到稳定的运动信息之后再对历史帧进行频率滤波。
6. 实验结果
实验条件
本实验对HDO、M3SVD、NOT-156以及VT MOT四个红外-可见光视频数据集进行研究。
第一阶段训练50个周期、批量大小为16;第二阶段训练100个周期、批量大小为2。使用AdamW作为优化器,学习率是
推理用的是50步DDIM采样的方法,历史窗口大小是8个时间点,使用的GPU是两张NVIDIA A40。
融合质量用CC、EN和SSIM来衡量,时序一致性用BiSWE和MS2RF来评价。
6.2 融合的质量和时序的稳定性
从表一中的 12 个融合质量的结果来看,DRFusion 得到最好的八项以及第二好的两项。
表1 DRFusion 在结构上具有很大的优势,并且也考虑到了源图象的相关性以及信息量的问题。
从时间序列的角度来看,在M3SVD和VTMOT的BiSWE、MS2RF等指标中,DRFusion都取得了最好的成绩,在NOT-156上也得到了最小的MS2RF值。
表2 DRFusion可以有效地降低相邻帧之间没有意义的变化。
6.3 定性的结论
图3表明,DRFusion可以很好地保持车、人等物体的红外轮廓,并且还保住了可见光背景的纹理信息,在此之上目标边界也更为清楚一些。
图3 此图对比了热目标的清晰程度、背景纹理以及重影与模糊的情况。
图4 M3SVD 数据集上的帧间差异可视化与时序一致性评估。
目标跟踪的结果
本文用未做任何修改的YOLOv1和ByteTrack在NOT-156上检验了目标跟踪的效果。
DRFusion 的AUC值为0.252,DP@20为0.230,SR@0.5和SR@0.75分别为0.263、0.121,并且这三项都排在第一位。
表4 NOT-156 数据集上的目标跟踪性能定量对比。
DRFusion 产生的视频可以给目标定位以及持续追踪带来更加稳定的数据。
图7 在NOT-156上目标追踪的可视化结果。
消融实验
完整的模型在NOT-156上得到CC=0.458、EN=6.664、SSIM=0.612、BISWE=4.816和MS2RF=0.332的结果。
去掉潜变量之后,CC 变为 0.328;去掉历史指导之后,BiSWE、MS2RF 分别变为了 5.238、0.361,表明结构细化和稳定的历 史引导都是必不可少的。
表3 完整的模型可以获得最好的效果。
图5 消融实验定性比较结果。
图6 M3SVD 数据集上不同消融变体的帧间差异与时序一致性对比。
模型复杂度
论文没有提及参数数量、FLOPs(浮点运算次数)以及推理的速度。因为推理要进行五十次扩散采样、对各种不同的历史情况进行预测以及对周期性的潜在变量进行细化,所以它的计算成本可能会比一般的前馈合并网络大一些。
7、总结和展望
DRFusion把红外-可见光视频融合建模为基于历史条件生成的过程,并且利用了时间序列稳定的潜在空间、红外结构匹配以及历史频率分量滤波来提高融合的效果和长时间内的时序一致度。
目前该论文的方法仍然没有对参数数量以及推理速度进行研究,在下游实验中主要是针对目标追踪的任务来进行测试。以后可以继续检验它在视频检测、语义分割以及自动驾驶感知等方面的应用效果。
一句话总结:DRFusion把历史帧和刚性的对齐方式改为用经过频率滤波后的软运动先验来实现时间上的一致性,在此基础上进行视频融合的方法也有了新的思路。