国内刊号:51-1307/TP
国际刊号:1001-9081
发布日期:
作者:刘晋文, 王磊, 马博, 董瑞, 杨雅婷, 艾合塔木江·艾合麦提, 王欣乐
单位:1.中国科学院 新疆理化技术研究所,乌鲁木齐 830011;2.中国科学院大学,北京 100049;3.新疆民族语音语言信息处理实验室,乌鲁木齐 830011;4.河海大学,南京 210000
关键词:单模态弱监督,对比学习,门控集成,多模态,有害信息检测
基金:新疆维吾尔自治区自然科学基金重点项目(2023D01D17);“天山英才”科技创新领军人才项目(2022TSYCLJ0046);新疆维吾尔自治区重点研发计划项目(2023B03024);中国科学院青年创新促进会资助项目(Y2021112);新疆维吾尔自治区“天山英才”培养计划项目(2023TSYCCX0041)
社交媒体上多模态有害信息的泛滥不仅损害公众利益,还严重扰乱社会秩序,亟需有效的检测方法。现有研究依赖预训练模型提取与融合多模态特征,忽视了通用语义在有害信息检测任务中的局限性,且未能充分考虑有害信息复杂多变的组合形式。为此,提出一种基于弱监督模态语义增强的多模态有害信息检测方法(weak-S),所提方法通过引入弱监督模态信息辅助多模态特征的有害语义对齐,并设计一种低秩双线性池化的多模态门控集成机制,以区分不同信息的贡献度。实验结果表明,所提方法在Harm-P和MultiOFF数据集上的F1值相较于SOTA (State-Of-The-Art)模型分别提高了2.2和3.2个百分点,验证了弱监督模态语义在多模态有害信息检测中的重要性。此外,所提方法在多模态夸张检测任务上取得了泛化性能的提升。
来源:2025年第10期
《计算机应用》期刊编辑部