基于预训练SAM的语义保持红外-可见光多模态融合语义分割方法OA
针对红外-可见光图像融合中长期存在的视觉融合质量与语义任务精度之间难以兼顾的问题,本文提出一种基于语义先验的多模态语义分割增强框架。现有红外-可见光融合方法虽然能够在一定程度上提升融合图像的视觉质量,但往往会削弱图像中的语义信息表达,从而影响下游语义分割任务的性能。为解决这一问题,本文引入预训练的SAM(Segment Anything Model)作为冻结的语义先验模型,在融合过程中对多模态特征学习进行引导,以保持语义信息的一致性。在所提框架中,RGB图像与红外图像首先部分输入SAM编码器以获取多层级视觉特征表示,同时通过专门设计的融合模块提取不同模态之间的互补特征。在各个特征阶段,SAM提取的特征通过语义保持分支进行进一步优化,并引入语义感知跨模态增强模块进行特征强化。该模块通过融合文本标签嵌入信息,提高模型对不同类别目标的响应能力,并有效提升目标边界区域的分割精度。实验结果表明,所提方法在语义信息保持能力、融合精度以及视觉重建质量等方面均取得了显著提升,验证了该框架在红外-可见光语义分割任务中的有效性与稳定性。
陈悦;许锋;李昊文
中国刑事警察学院公安信息技术与情报学院,辽宁沈阳110854中国刑事警察学院公安信息技术与情报学院,辽宁沈阳110854中国刑事警察学院公安信息技术与情报学院,辽宁沈阳110854
信息技术与安全科学
多模态语义分割红外-可见光图像融合预训练SAM特征调制门控融合机制语义先验跨模态学习
《液晶与显示》 2026 (5)
P.734-753,20
“十三五”国家重点研发技术项目(No.2017YFC0821004)2022辽宁省教育厅基本科研重大攻关项目(No.LJKZZ20220007)中央高校基本科研业务重大项目培育计划。
评论