国内刊号:51-1307/TP
国际刊号:1001-9081
发布日期:
作者:盛坤, 王中卿
单位:苏州大学 计算机科学与技术学院,江苏 苏州 215006
关键词:大语言模型,数据增强,通感隐喻,数据稀疏,数据合成
基金:国家自然科学基金资助项目(62076175)
中文通感隐喻分析任务是隐喻领域的一个特定细分任务。由于通感语料中感觉词的分布不均匀,中文通感隐喻数据集存在数据稀疏的问题。为解决这一问题,利用真实训练数据中的稀疏感觉词数据作为提示,并使用大语言模型生成额外的合成样本进行数据增强。为避免合成数据的引入造成的额外噪声影响模型性能,构建基于大语言模型的数据增强框架,并采用评分机制和标签误差优化机制减小合成数据和真实数据之间的分布差异。实验结果表明,所提框架可以生成高质量的合成数据来扩充数据集,在感觉词抽取和感觉领域分类任务上的总体F1值达到68.5%,比仅使用真实训练数据的基线模型T5(Text-To-Text Transfer Transformer)提升了2.7个百分点。
来源:2025年第3期
《计算机应用》期刊编辑部