视频文本语义对齐与全视频依赖的弱监督时序动作定位OA
针对现有弱监督时序动作定位(WTAL)研究存在的未充分利用动作的时序特性、全局特性和动作语义一致性等问题,提出视频文本语义对齐与全视频依赖的方法(FVD-ALM),充分利用多源信息以提升动作定位的准确性和鲁棒性。首先,依托膨胀卷积扩大模型的感受野,结合注意力机制对视频内动作的变化实施精确的特征强化,确保获得准确的时序特征,捕捉动作的动态变化。随后,采用基于高斯混合模型(GMM)的期望最大化(EM)算法提取并强化视频中的全局信息,生成精确的时序激活图,理解视频的整体内容,辅助动作的定位过程。最后,设计视频文本语义对齐模块,结合动作标签中的文本信息全面理解动作,训练模型补全描述动作的文本信息,增强模型对动作类别一致性的认知并有效区分不同动作类别。实验结果表明,在THUMOS14和ActivityNet1.3这两个主流数据集上,该方法均有效,其中在THUMOS14上实现了39.1%的均值平均精度(mAP),比DTRP-Loc方法提高了2.0百分点,证实了结合多源信息的方法能够显著提高动作定位的准确性,为WTAL任务提供了一种有效的解决方案。
党伟超;裴丽仙;高改梅;刘春霞
太原科技大学计算机科学与技术学院,山西太原030024太原科技大学计算机科学与技术学院,山西太原030024太原科技大学计算机科学与技术学院,山西太原030024太原科技大学计算机科学与技术学院,山西太原030024
信息技术与安全科学
弱监督动作定位视频文本语义对齐全视频依赖伪标签生成多模态融合
《计算机工程》 2026 (7)
P.354-367,14
山西省自然科学基金(202203021211194,202403021221141)。
评论