声明
严正声明:本站非期刊官网,非中介代理。
本站仅提供学术规范服务:快速预审、润色编辑服务、中英文查重、降重、去重服务、推荐合适的期刊投稿等学术规范服务。 如需提供学术规范服务请联系在线编辑。
国内刊号:51-1307/TP
国际刊号:1001-9081
发布日期:
作者:冯智达, 陈黎
单位:1.武汉科技大学 计算机科学与技术学院, 武汉 430065;2.智能信息处理与实时工业系统湖北省重点实验室(武汉科技大学), 武汉 430065
关键词:计算机视觉,深度学习,场景文字检测,混叠文字,投影,Transformer算法
基金:国家自然科学基金资助项目(61773297)
针对基于分割的文字检测方法在混叠文字场景下性能下降的问题,提出了单向投影Transformer (SDPT)用于混叠文本检测。首先,使用深度残差网络(ResNet)和特征金字塔网络(FPN)提取并融合多尺度特征;然后,利用水平投影将特征图投影成向量序列,并送入Transformer模块进行建模,以挖掘文本行与行之间的关系;最后,使用多目标来进行联合优化。在合成数据集BDD-SynText和真实数据集RealText上进行了大量实验,结果表明,所提SDPT在高混叠度的文字检测下取得了最优的效果,而与PSENet等文本检测算法在相同骨干网络(ResNet50)条件下相比,在BDD-SynText上F1-Score(IoU75)至少提高了21.36个百分点,在RealText上的F1-Score (IoU75)至少提高了18.11个百分点,验证了所提方法对于混叠文字检测性能改善的重要作用。
来源:2022年第12期
《计算机应用》期刊编辑部
严正声明:本站非期刊官网,非中介代理。
本站仅提供学术规范服务:快速预审、润色编辑服务、中英文查重、降重、去重服务、推荐合适的期刊投稿等学术规范服务。 如需提供学术规范服务请联系在线编辑。