国内刊号:51-1307/TP
国际刊号:1001-9081
发布日期:
作者:殷兵, 凌震华, 林垠, 奚昌凤, 刘颖
单位:1.科大讯飞股份有限公司,合肥 230000;2.中国科学技术大学 信息科学技术学院,合肥 230026
关键词:情感识别,多模态,模态缺失,预训练,深度学习
基金:国家重点研发计划项目(2022YFB4500600)
针对真实复杂场景下模态缺失带来的模型兼容性问题,提出一种支持任意模态输入的情感识别方法。首先,在预训练和精调阶段,采用模态随机丢弃的训练策略保证模型在推理阶段的兼容性;其次,分别提出时空掩码策略和基于跨模态注意力机制的特征融合机制,以减少模型过拟合的风险并优化模型跨模态特征融合的效果;最后,为了解决多种模态情感标签不一致带来的噪声标签问题,提出一种基于多原型聚类的自适应去噪策略,该策略为多种模态分别设置类中心,并通过对比每种模态特征对应的聚类类别与标签的一致性去除噪声标签。实验结果表明:在自建数据集上,所提方法相比基线AV-HuBERT(Audio-Visual Hidden unit Bidirectional Encoder Representation from Transformers)在加权平均召回率(WAR)指标上,模态对齐推理、视频缺失推理和音频缺失推理分别提升了6.98、4.09和33.05个百分点;在视频公开数据集DFEW上,相较于AV-HuBERT,所提方法取得了最高的WAR指标,达到了68.94%。
来源:2025年第9期
《计算机应用》期刊编辑部