国内刊号:51-1307/TP
国际刊号:1001-9081
发布日期:
作者:康斌, 陈斌, 王俊杰, 李昱林, 赵军智, 咸伟志
单位:1.中国科学院 成都计算机应用研究所,成都 610213;2.中国科学院大学 计算机科学与技术学院,北京 100049;3.哈尔滨工业大学(深圳) 国际人工智能研究院,广东 深圳 518055;4.哈尔滨工业大学(深圳) 计算机科学与技术学院,广东 深圳 518055;5.西南交通大学 信息科学与技术学院,成都 611756;6.哈尔滨工业大学 重庆研究院,重庆 401151
关键词:视觉-语言模型,人物检索,全局对齐,局部对齐,共享语义中心
基金:深圳市稳定支持面上项目(GXWD-20220811170603002)
基于文本的人物检索旨在通过使用文本描述作为查询来识别特定人物。现有的先进方法通常设计多种对齐机制实现跨模态数据在全局和局部的对应关系,然而忽略了不同对齐机制之间的相互影响。因此,提出一种多粒度共享语义中心关联机制,深入探索全局对齐和局部对齐之间的促进和抑制效应。首先,引入一个多粒度交叉对齐模块,并通过增强图像-句子和局部区域-分词之间的交互,实现跨模态数据在联合嵌入空间的多层次对齐;其次,建立一个共享语义中心,将它作为一个可学习的语义枢纽,并通过全局特征和局部特征的关联,增强不同对齐机制之间的语义一致性,促进全局和局部特征的协同作用。在共享语义中心内,计算图像特征和文本特征之间的局部和全局跨模态相似性关系,提供一种全局视角与局部视角的互补度量,并最大限度地促进多种对齐机制之间的正向效应;最后,在CUHK-PEDES数据集上进行实验。结果表明:所提方法在Rank-1指标上较基线方法显著提升了8.69个百分点,平均精度均值(mAP)提升了6.85个百分点。在ICFG-PEDES和RSTPReid数据集上所提方法也取得了优异的性能,明显超越了所有对比方法。
来源:2025年第3期
《计算机应用》期刊编辑部