国内刊号:51-1307/TP
国际刊号:1001-9081
发布日期:
作者:习怡萌, 邓箴, 刘倩, 刘立波
单位:1.宁夏大学 信息工程学院,银川 750021;2.宁夏“东数西算”人工智能与信息安全重点实验室(宁夏大学),银川 750021
关键词:跨模态检索,视频-文本检索,多特征融合,弱语义数据,自适应
基金:国家自然科学基金资助项目(62262053);宁夏科技创新领军人才项目(2022GKLRLX03);宁夏大学研究生创新项目(CXXM202406);宁夏高等学校科学研究项目(NYG2024023)
现有的视频-文本检索(VTR)方法通常假设文本描述与视频之间存在强语义关联,却忽略了数据集中广泛存在的弱相关视频文本对,导致模型虽然擅长识别常见的通用概念,但无法充分挖掘弱语义描述的潜在信息,进而影响模型的检索性能。针对上述问题,提出一种跨模态信息融合的VTR模型,该模型以跨模态的方式利用相关的外部知识改进模型的检索性能。首先,构建2个外部知识检索模块,分别用于实现视频与外部知识的检索以及文本与外部知识的检索,以便后续借助外部知识强化原始视频和文本的特征表示;其次,设计自适应交叉注意力的跨模态信息融合模块,以去除视频和文本中的冗余信息,并利用不同模态间的互补信息融合特征,学习更具判别性的特征表示;最后,引入模态间和模态内的相似性损失函数,以确保数据在融合特征空间、视频特征空间和文本特征空间下信息表征的完整性,从而实现跨模态数据间的精准检索。实验结果表明,与MuLTI模型相比,所提模型在公共数据集MSR-VTT (Microsoft Research Video to Text)和DiDeMo (Distinct Describable Moments)上的召回率R@1分别提升了2.0和1.9个百分点;与CLIP-ViP模型相比,所提模型在公共数据集LSMDC (Large Scale Movie Description Challenge)上的R@1提高了2.9个百分点。可见,所提模型能有效解决VTR任务中的弱相关数据的问题,从而提升模型的检索准确率。
来源:2025年第8期
《计算机应用》期刊编辑部