基于注视引导的复杂环境视频人-物交互检测模型OA
针对基于视频的人-物交互检测存在的鲁棒性不足问题,提出基于注视引导的复杂环境视频人-物交互检测模型。该模型利用基于特征相似度的头身匹配算法,提高了头身匹配准确率;设计特征融合模块,将图像、文本和注视热力图特征进行有效融合。在VidHOI数据集上,本文模型全部类的mAP比性能最好的对比模型HOIGF提高了0.84;在Action Genome数据集上,本文模型全部类的Rec@10比性能最好的对比模型HOIGF提高了0.7。该模型提升了复杂环境下视频人-物交互检测的准确性,具有较好的鲁棒性。
钱政华;林剑峰;潘星;陈辉;陈静霖;林宜轩;王玉琛
华电新能源集团股份有限公司福建分公司,福建福州350000华电新能源集团股份有限公司福建分公司,福建福州350000华电新能源集团股份有限公司福建分公司,福建福州350000华电新能源集团股份有限公司福建分公司,福建福州350000华电新能源集团股份有限公司福建分公司,福建福州350000华电新能源集团股份有限公司福建分公司,福建福州350000南京南自信息技术有限公司,江苏南京210032
信息技术与安全科学
人-物交互检测注视引导特征融合特征相似度匹配
《自动化与信息工程》 2026 (1)
P.67-74,8
评论