国内刊号:51-1307/TP
国际刊号:1001-9081
发布日期:
作者:黄朋, 林佳瑜, 梁祖红
单位:1.广东工业大学 计算机学院,广州 510006;2.广东工业大学 图书馆,广州 510006;3.广东工业大学 实验教学部,广州 510006
关键词:提示学习,对比学习,互信息,注意力张量,去噪,无监督
基金:教育部产学合作协同育人项目(220901229305933);2024年度广州市基础研究计划?市校院企联合资助专题项目(2024A03J1199)
中文无监督对比学习面临多重挑战:1)中文句子结构灵活多变,语义模糊性较高,使得模型难以准确捕捉深层语义特征;2)在小规模数据集上,对比学习模型的特征表达能力不足,难以充分学习到有效的语义表示;3)数据增强过程中可能引入多余噪声,进一步加剧训练的不稳定性。这些问题共同限制了模型在中文语义理解上的表现。为了解决这些问题,提出一种基于互信息(MI)和提示学习的中文无监督对比学习(CMIPL)方法。首先,采用提示学习的数据增强方式构建对比学习所需的样本对,在保留全部文本信息和顺序的同时增加文本多样性,规范样本的输入结构,并为输入样本提供提示模板作为上下文,引导模型更深入地学习细粒度语义;其次,在预训练语言模型输出表示的基础上,使用提示模板去噪方法去除数据增强所引入的多余噪声;最后,将正样本结构信息融入模型训练体系之中,计算增强视图的注意力张量的MI,再将注意力MI引入损失函数,通过最小化损失函数,优化模型注意力的分布,最大化增强视图结构的对齐,使模型更好地拉近正样本对的距离。在ATEC、BQ、PAWSX这3个公开中文文本相似度数据集构建的小样本数据上进行对比实验。结果表明,所提方法的平均性能最佳,特别是在训练集数据量较少的情况下,在使用1%和10%样本量的条件下,与基线对比学习模型SimCSE(Simple Contrastive learning of Sentence Embeddings)相比,CMIPL的平均准确率和斯皮尔曼等级相关系数(SR)分别提高了3.45、4.07和1.64、2.61个百分点,验证了CMIPL在小样本中文无监督对比学习领域的有效性。
来源:2025年第10期
《计算机应用》期刊编辑部