计算机应用

北大核心,INSPEC,JST,Pж(AJ),CSCD扩展版

国内刊号:51-1307/TP

国际刊号:1001-9081

计算机应用杂志2025年第10期:针对中文文本分类的多模态对抗样本生成方法

发布日期:

作者:王永平, 刘垚, 张晓琳, 王静宇, 刘立新

单位:1.内蒙古科技大学 自动化与电气工程学院,内蒙古 包头 014010;2.内蒙古科技大学 数智产业学院(网络安全学院),内蒙古 包头 014010;3.中国人民大学 信息学院,北京 100872

关键词:深度学习,文本分类,对抗样本,多模态,对抗攻击

基金:国家自然科学基金资助项目(62466045);内蒙古自然科学基金资助项目(2023MS06012);内蒙古自治区直属高校科研业务费专项资金资助项目(2023RCTD027);内蒙古自治区直属高校科研业务费专项资金资助项目(2024QNJS047)

针对现有中文文本对抗样本生成方法中重要词定位方法和变换策略单一,导致攻击成功率和对抗样本质量难以提高的问题,从汉字的形态、发音和语义角度,提出一种针对中文文本分类的多模态对抗样本生成方法。在计算词语重要性阶段,利用掩码模型和模型输出得到置信概率,并计算预测词的离散性且将它作为位置的敏感性,最终结合二者以确定扰动优先级;在对抗变换阶段,设计一种结合汉字的音形和语义特征的多模态攻击策略生成对抗样本,并通过词典、基于卷积神经网络(CNN)的字形相似比较模型和掩码语言模型(MLM)生成候选样本。实验结果表明,所提方法能对鲁棒性较强的BERT(Bidirectional Encoder Representations from Transformers)和RoBERTa(Robustly optimized BERT pretraining approach)模型实现了33.2%~65.8%的攻击成功率。可见,通过对抗训练生成的对抗样本可以提升模型的鲁棒性。

来源:2025年第10期

《计算机应用》期刊编辑部

查看计算机应用杂志2025年第10期

联系我们

  • 地址:四川天府新区兴隆街道科智路1369号
  • 电话:028-85224283-803
  • E-mail:bjb@joca.cn

咨询工作人员