首页|期刊导航|液晶与显示|基于多机制融合增强的跨模态行人重识别方法

基于多机制融合增强的跨模态行人重识别方法OA

中文摘要

针对现有基于ViT的跨模态行人重识别方法存在的注意力噪声干扰、缺乏精细化空间关系建模及计算冗余等问题,本文提出了一种多机制融合增强的跨模态行人重识别方法。该方法以ViT为基准模型,采用多维特征融合策略提升表达能力。首先,引入差分注意力(DAM)模块,通过计算两组平行注意力图的差异,有效抑制背景中高频出现的共性噪声,显著提升模型对行人主体区域的关注度;其次,设计层级渐进的关系感知模块(RAM),自适应进行由局部到全局的空间关系建模,有效克服了ViT在处理遮挡和姿态变化时易丢失空间结构信息的局限;最后,融合十字交叉窗口自注意力(CSWA)机制,通过将特征图划分为水平和垂直条带进行并行自注意力计算,在将计算复杂度降至线性级的同时,高效捕捉长距离全局依赖。实验结果表明,在MSMT17数据集上,mAP和Rank-1分别达到68.1%和86.3%;在Occluded-Duke数据集上,mAP和Rank-1分别提升了5.5%和6.3%;在Market-1501与DukeMTMC-reID数据集上也取得了优于传统ViT的检索性能。综合结果表明,本方法有效解决了传统ViT模型在行人重识别任务中面临的特征发散和空间信息丢失问题,显著增强了模型在遮挡和复杂背景下的鲁棒性与泛化能力。

涂明君;林国军;冯凯;马润

四川轻化工大学自动化与信息工程学院,四川宜宾644000四川轻化工大学自动化与信息工程学院,四川宜宾644000 智能感知与控制四川省重点实验室,四川宜宾644000四川轻化工大学自动化与信息工程学院,四川宜宾644000四川轻化工大学自动化与信息工程学院,四川宜宾644000 智能感知与控制四川省重点实验室,四川宜宾644000

信息技术与安全科学

行人重识别跨模态ViTDAMCSWARAM

《液晶与显示》 2026 (5)

P.675-686,12

国家自然科学基金(No.42405145)四川省科技厅项目(No.2024YFHZ0026)四川省自然科学基金(No.2025ZNSFSC0477,No.2024NSFSC2042)。

10.37188/CJLCD.2026-0043

评论