基于多模态交叉对齐网络的小样本图像语义分割OA
针对现有小样本图像语义分割方法对未知图片中目标定位不精确的问题,提出一种基于多模态交叉对齐网络的小样本图像语义分割方法。首先,利用一组共享权重的主干网络将支持图片和查询图片映射到深度特征空间,提取图片在视觉维度的编码特征。其次,利用预训练的CLIP文本编码器将支持图片中的目标类信息编码到文本空间中,捕获目标类对应的文本语义。再次,利用交叉注意力机制建立文本和视觉空间的特征交互,促进不同模态间的语义对齐。最后,利用临时预测的查询掩码建立反向交叉指导策略,指导原始支持图片中已知目标的掩码预测。在开源的PASCAL和COCO数据集上进行了对比实验和消融实验,实验结果验证了所设计方法在处理查询图片中未知目标时的优越性。
周莹;赵国栋
天津开放大学理工学部,天津300350宁夏大学网络与信息中心,宁夏银川750021
信息技术与安全科学
图像语义分割小样本学习多模态交叉对齐反向交叉指导CLIP
《燕山大学学报》 2026 (1)
P.76-84,94,10
宁夏自然科学基金资助项目(2021AAC03118)。
评论