首页|期刊导航|无线电通信技术|基于特征交互的差异化场景文本定位识别方法

基于特征交互的差异化场景文本定位识别方法OA

中文摘要

在现实场景中应用文本定位识别方法时,推广至与训练数据场景存在差异的新场景的能力必不可少。然而,现有多数方法采用海量数据驱动方式,将大量常见场景文本图像数据输入深度学习模型进行预训练或微调,此类模型在公共测试集上可取得良好性能,但缺乏适配新场景的应用能力。为此,提出一种基于特征交互的差异化场景文本定位识别网络(Feature Interaction-based Differential Scene Text Spotter Network,FIDNet),可对常见场景与新场景的文本实现高效定位识别。FIDNet采用文本定位与文本识别协同化架构,借助多层次双向融合(Multi-Level Bidirectional Fusion,MLBF)网络深度提取图像特征,对潜在子任务对应的文本特征开展自适应加权交互与迭代优化,进一步提升模型文本定位识别性能。实验结果表明,所提方法可有效定位识别各类形状文本,并能快速应用于新场景。

黄海权;韩光

南京邮电大学通信与信息工程学院,江苏南京210003南京邮电大学通信与信息工程学院,江苏南京210003

信息技术与安全科学

文本定位识别文本识别多层次双向融合自适应特征加权交互

《无线电通信技术》 2026 (3)

P.690-697,8

国家自然科学基金(61871445)。

10.3969/j.issn.1003-3114.2026.03.020

评论