国内刊号:51-1307/TP
国际刊号:1001-9081
发布日期:
作者:吴祖成, 吴小俊, 徐天阳
单位:江南大学 人工智能与计算机学院,江苏 无锡 214122
关键词:跨模态检索,图像文本检索,关系提取,图卷积网络,三元组损失
基金:国家自然科学基金资助项目(62020106012)
针对跨模态检索任务中关系具有多样性,以及基于外观的传统范式无法准确反映图像中显著物体间的关联,使得它在复杂场景中的应用效果不佳的问题,提出一种基于模态内细粒度特征关系提取的图像-文本检索模型。首先,为了获得更直观的位置信息,将图像划分为网格,并通过物体与网格的位置关系建立位置表征;其次,为了在关系建模阶段保持节点信息的稳定性和独立性,使用一个跨模态信息指导的特征融合模块;最后,提出一种自适应三元组损失用于动态平衡正负样本的训练权重。实验结果表明,所提模型在Flickr30K和MS-COCO 1K数据集上与模型CHAN(Cross-modal Hard Aligning Network)相比,在R@sum指标(前1,5,10个图像检索文本和文本检索图像的召回率之和)上分别提升了1.5%和0.02%,以上结果验证了所提模型在检索的召回率上的有效性。
来源:2024年第12期
《计算机应用》期刊编辑部