语义可控的红外与可见光图像融合OA
针对现有红外与可见光图像融合任务对开放式文本指令驱动的融合需求,本文提出一种基于可学习频带分解与文本引导门控的红外-可见光图像融合框架。通过语言–图像预训练模型(Contrastive Language-Image Pre-training,CLIP)与基于文本提示的通用分割模型(Grounded Segment Anything Model,Grounded SAM)协同构建文本-图像对齐模块,精准关联文本语义先验与图像局部区域,为双模态特征提取设计专属可学习频带分解模块,自适应分离表征整体结构的低频基底与刻画精细纹理的高频细节。随后设计文本感知门控融合模块,实现空间自适应调控红外与可见光模态的特征贡献权重,构建多约束损失函数,涵盖梯度保真、门控图正则损失等核心约束项,显式保障融合结果的结构完整性与文本语义一致性。实验结果表明:在LLVIP数据集上,本文网络相对于Textfusion的文本相关指标:边缘保持增强指标(Qabf+)和结构相似性增强指标(SSIM+)分别提升0.0705和0.0364,常见图像融合指标互信息(Mutual Information,MI)和峰值信噪比(Peak Signal-to-Noise Ratio,PSNR)分别提升1.5164和1.7566 dB,在目标检测任务中交并比阈值范围为0.5~0.95的平均精度均值(mean Average Precision,mAP@50-95)提升0.9%。在实际融合中文本能够有效引导图像融合的生成过程,基本实现语义可控的图像融合目标。
柳长源;程兵云;吴海滨
哈尔滨理工大学测控技术与通信工程学院,黑龙江哈尔滨150080哈尔滨理工大学测控技术与通信工程学院,黑龙江哈尔滨150080哈尔滨理工大学测控技术与通信工程学院,黑龙江哈尔滨150080
信息技术与安全科学
图像融合文本引导红外图像可见光图像频带分解
《光学精密工程》 2026 (12)
P.1954-1968,15
黑龙江省交通运输厅科技项目(No.HJK2024B002)。
评论