基于学习提示和双模态适配器的小样本图像分类算法OA
图像分类作为计算机视觉领域的核心任务之一,是实现图像检索、目标检测、场景理解等复杂视觉任务的基础,已成为人工智能技术落地与产业升级的重要支撑。针对小样本图像分类中依赖人工设计文本提示、模型泛化能力不足及易过拟合等问题,开展了融合可学习提示与双模态适配器的COCLIP-Adapter算法研究。该算法以CLIP为基础,设计可学习文本提示向量模块生成动态文本提示,结合双模态适配器模块优化视觉与文本特征,并采用多任务损失函数增强跨模态对齐。实验显示,在ImageNet上,COCLIP-Adapter相较CLIP,1-shot分类准确率提升39.65%、16-shot提升10.09%;较Tip-Adapter-F,2-16-shot各提升1.05%~0.26%、0.45%。在Caltech101上,相较于CLIP,1-shot提升19.14%、16-shot提升2.61%;相较Tip-Adapter-F,1-16-shot各提升0.38%~0.48%。这表明其低样本特征学习能力更强,能有效提升小样本图像分类性能,可在标注样本稀缺的实际场景中提供更可靠的技术支撑。
刘芳;徐亦飞;谢天乐;李思奇
西安石油大学理学院,西安710065西安交通大学电信学部软件学院,西安710049西安交通大学电信学部软件学院,西安710049西安交通大学电信学部软件学院,西安710049
信息技术与安全科学
小样本图像分类可学习提示双模态适配器跨模态对齐
《计算机应用研究》 2026 (7)
P.2234-2240,7
陕西省自然基金基础计划面上项目(2024JC-YBMS-498)。
评论