国内刊号:51-1307/TP
国际刊号:1001-9081
发布日期:
作者:郭诗月, 党建武, 王阳萍, 雍玖
单位:1.兰州交通大学 电子与信息工程学院,兰州 730070;2.甘肃省人工智能与图形图像处理工程研究中心(兰州交通大学),兰州 730070
关键词:手部姿态估计,多尺度特征融合,注意力机制,高分辨率网络,沙漏网络
基金:国家自然科学基金资助项目(62067006);甘肃省知识产权计划项目(21ZSCQ013);甘肃省高校科研创新平台重大培育项目(2024CXPT?17);教育部人文社会科学研究项目(21YJC880085);甘肃省自然科学基金资助项目(23JRRA845);兰州市青年科技人才创新项目(2023?QN?117)
针对因遮挡和自相似性导致的从单张RGB图像估计三维手部姿态不精确的问题,提出结合注意力机制和多尺度特征融合的三维手部姿态估计算法。首先,提出结合扩张卷积和CBAM (Convolutional Block Attention Module)注意力机制的感受强化模块(SEM),以替换沙漏网络(HGNet)中的基本块(Basicblock),在扩大感受野的同时增强对空间信息的敏感性,从而提高手部特征的提取能力;其次,设计一种结合SPCNet (Spatial Preserve and Content-aware Network)和Soft-Attention改进的多尺度信息融合模块SS-MIFM (SPCNet and Soft-attention-Multi-scale Information Fusion Module),在充分考虑空间内容感知机制的情况下,有效地聚合多级特征,并显著提高二维手部关键点检测的准确性;最后,利用2.5D姿态转换模块将二维姿态转换为三维姿态,从而避免二维关键点坐标直接回归计算三维姿态信息导致的空间丢失问题。实验结果表明,在InterHand2.6M数据集上,所提算法的双手关节点平均误差(MPJPE)、单手MPJPE和根节点平均误差(MRRPE)分别达到了12.32、9.96和29.57 mm;在RHD(Rendered Hand pose Dataset)上,与InterNet和QMGR-Net算法相比,所提算法的终点误差(EPE)分别降低了2.68和0.38 mm。以上结果说明了所提算法能够更准确地估计手部姿态,且在一些双手交互和遮挡的场景下有更高的鲁棒性。
来源:2025年第4期
《计算机应用》期刊编辑部