基于特征交互的差异化场景文本定位识别方法OA
在现实场景中应用文本定位识别方法时,推广至与训练数据场景存在差异的新场景的能力必不可少。然而,现有多数方法采用海量数据驱动方式,将大量常见场景文本图像数据输入深度学习模型进行预训练或微调,此类模型在公共测试集上可取得良好性能,但缺乏适配新场景的应用能力。为此,提出一种基于特征交互的差异化场景文本定位识别网络(Feature Interaction-based Differential Scene Text Spotter Network,FIDNet),可对常见场景与新场景的文本实现高效定位识别。FIDNet采用文本定位与文本识别协同化架构,借助多层次双向融合(Multi-Level Bidirectional Fusion,MLBF)网络深度提取图像特征,对潜在子任务对应的文本特征开展自适应加权交互与迭代优化,进一步提升模型文本定位识别性能。实验结果表明,所提方法可有效定位识别各类形状文本,并能快速应用于新场景。
黄海权;韩光
南京邮电大学通信与信息工程学院,江苏南京210003南京邮电大学通信与信息工程学院,江苏南京210003
信息技术与安全科学
文本定位识别文本识别多层次双向融合自适应特征加权交互
《无线电通信技术》 2026 (3)
P.690-697,8
国家自然科学基金(61871445)。
评论