基于跨模态语义提示的多目标跟踪OA
语义提示多目标跟踪旨在通过语义提示将高层语义信息引入视觉跟踪过程,实现对目标的语义感知与持续关联。然而,在复杂动态场景中,该任务仍易受到目标身份频繁切换、严重遮挡以及时间一致性不足等问题的影响,其根源在于现有方法监督信号多样性不足以及跨帧空间关系建模能力有限。为此,本文提出一种端到端语义提示多目标跟踪框架enLPMOT(enhanced language-prompt multi-object tracking)。该方法通过分组查询监督机制引入一对多分配策略,以提升监督多样性;设计增强双路径解码结构,通过原始查询与噪声增强查询的并行解码与自适应融合,提高模型在遮挡与外观变化场景下的鲁棒性;同时引入显式相对几何编码对跨帧空间依赖关系进行建模,以增强轨迹的时间一致性。实验结果表明,本文方法在多个评测指标上均取得具有竞争力的性能。其中,高阶跟踪准确率(higher order tracking accuracy,HOTA)达到40.30%,检测准确率(detection accuracy,DetA)为30.60%,关联召回率(association recall,AssR)与关联精确率(association precision,AssP)分别达到55.77%和83.53%。
张灿龙;徐柏帆;黄洪锦;卢小春;韦春荣
教育区块链与智能技术教育部重点实验室(广西师范大学),广西桂林541004 广西多源信息挖掘与安全重点实验室(广西师范大学),广西桂林541004教育区块链与智能技术教育部重点实验室(广西师范大学),广西桂林541004教育区块链与智能技术教育部重点实验室(广西师范大学),广西桂林541004教育区块链与智能技术教育部重点实验室(广西师范大学),广西桂林541004广西师范大学职业技术师范学院,广西桂林541004
信息技术与安全科学
多目标跟踪语义提示跟踪跨模态融合多组查询监督空间位置编码
《广西师范大学学报(自然科学版)》 2026 (5)
P.75-86,12
国家自然科学基金(62266009)广西重点研发计划(2024AB26006)。
评论