国内刊号:51-1307/TP
国际刊号:1001-9081
发布日期:
作者:贾洁茹, 杨建超, 张硕蕊, 闫涛, 陈斌
单位:1.山西大学 大数据科学与产业研究院, 太原 030006;2.山西大学 计算机与信息技术学院, 太原 030006;3.山西省机器视觉与数据挖掘工程研究中心(山西大学), 太原 030006;4.哈尔滨工业大学重庆研究院, 重庆 401151;5.哈尔滨工业大学(深圳)国际人工智能研究院, 广东 深圳 518055
关键词:行人重识别,无监督学习,视觉Transformer,知识蒸馏,特征表示
基金:国家自然科学基金资助项目(62106133);中央引导地方科技发展资金资助项目(YDZJSX20231C001)
针对视觉Transformer(ViT)缺乏归纳偏置,导致在相对小规模的行人重识别数据上难以学习有意义的视觉表征的问题,提出一种基于自蒸馏视觉Transformer的无监督行人重识别方法。首先,利用ViT的模块化架构,即每个中间块生成的特征维度相同的特性,随机选择一个中间Transformer块并将它送入分类器以得到预测结果;其次,通过最小化随机选择的中间分类器输出与最终分类器输出分布之间的Kullback-Leibler散度,约束中间块的分类预测结果与最终分类器的结果保持一致,据此构建自蒸馏损失函数;最后,通过对聚类级对比损失、实例级对比损失和自蒸馏损失进行联合最小化,对模型进行优化。此外,通过从最终分类器向中间块提供软监督,有效地给ViT模型引入归纳偏置,进而有助于模型学习更鲁棒和通用的视觉表征。与基于TransReID的自监督学习(TransReID-SSL)相比,在Market-1501数据集上,所提方法的平均精度均值(mAP)和Rank-1分别提升1.2和0.8个百分点;在MSMT17数据集上,所提方法的mAP和Rank-1分别提升3.4和3.1个百分点。实验结果表明,所提方法能够有效提高无监督行人重识别的精度。
来源:2024年第9期
《计算机应用》期刊编辑部