计算机应用

北大核心,INSPEC,JST,Pж(AJ),CSCD扩展版

国内刊号:51-1307/TP

国际刊号:1001-9081

计算机应用杂志2025年第10期:基于Swin Transformer与多尺度特征融合的图像描述方法

发布日期:

作者:王子怡, 李卫军, 刘雪洋, 丁建平, 刘世侠, 苏易礌

单位:1.北方民族大学 计算机科学与工程学院,银川 750021;2.图形图像智能处理国家民委重点实验室(北方民族大学),银川 750021

关键词:Swin Transformer,多尺度特征,特征融合,图像描述,深度可分离卷积

基金:国家自然科学基金资助项目(62066038);国家自然科学基金资助项目(61962001);中央高校基本科研业务费专项资金资助项目(2019KYQD04,2022PT_S04,2021JCYJ12);宁夏自然科学基金资助项目(2021AAC03215)

基于Transformer的图像描述方法通过多头注意力会在整个输入序列上计算注意力权重,缺乏层次化的特征提取能力,并且两阶段的图像描述方法限制了模型性能。针对上述问题,提出一种基于Swin Transformer与多尺度特征融合的图像描述方法(STMSF)。在编码器中通过Agent Attention保持全局上下文建模能力的同时,提高计算效率;在解码器中提出多尺度交叉注意力(MSCA),融合交叉注意力与深度可分离卷积,在得到多尺度特征的同时更充分地融合多模态特征。实验结果表明,在MSCOCO数据集上与SCD-Net(Semantic-Conditional Diffusion Network)方法相比,STMSF的BLEU4(BiLingual Evaluation Understudy with 4-grams)和CIDEr(Consensus-based Image Description Evaluation)指标分别提升了1.1和5.3个百分点。对比实验和消融实验的结果表明,所提的一阶段STMSF能够有效提高模型性能,生成高质量的图像描述语句。

来源:2025年第10期

《计算机应用》期刊编辑部

查看计算机应用杂志2025年第10期

联系我们

  • 地址:四川天府新区兴隆街道科智路1369号
  • 电话:028-85224283-803
  • E-mail:bjb@joca.cn

咨询工作人员