计算机应用

北大核心,INSPEC,JST,Pж(AJ),CSCD扩展版

国内刊号:51-1307/TP

国际刊号:1001-9081

计算机应用杂志2025年第1期:基于提示学习和全局指针网络的中文古籍实体关系联合抽取方法

发布日期:

作者:李斌, 林民, 斯日古楞null, 高颖杰, 王玉荣, 张树钧

单位:1.内蒙古师范大学 计算机科学技术学院,呼和浩特 010022;2.内蒙古民族大学 计算机科学与技术学院,内蒙古 通辽 028000;3.内蒙古师范大学 文学院,呼和浩特 010022;4.内蒙古师范大学 数学科学学院,呼和浩特 010022

关键词:实体关系联合抽取,全局指针网络,提示学习,预训练语言模型,中文古籍

基金:国家自然科学基金资助项目(62266033);内蒙古自然科学基金资助项目(2021LHMS06010);内蒙古自治区科技计划项目(2021GG0218);内蒙古自治区级教育部重点实验室开放课题(2023KFZD03);内蒙古自治区硕士研究生科研创新项目(S20231076Z);内蒙古师范大学基本科研业务费专项资金资助项目(2022JBXC018)

基于“预训练+微调”范式的实体关系联合抽取方法依赖大规模标注数据,在数据标注难度大、成本高的中文古籍小样本场景下微调效率低,抽取性能不佳;中文古籍中普遍存在实体嵌套和关系重叠的问题,限制了实体关系联合抽取的效果;管道式抽取方法存在错误传播问题,影响抽取效果。针对以上问题,提出一种基于提示学习和全局指针网络的中文古籍实体关系联合抽取方法。首先,利用区间抽取式阅读理解的提示学习方法对预训练语言模型(PLM)注入领域知识以统一预训练和微调的优化目标,并对输入句子进行编码表示;其次,使用全局指针网络分别对主、客实体边界和不同关系下的主、客实体边界进行预测和联合解码,对齐成实体关系三元组,并构建了PTBG (Prompt Tuned BERT with Global pointer)模型,解决实体嵌套和关系重叠问题,同时避免了管道式解码的错误传播问题;最后,在上述工作基础上分析了不同提示模板对抽取性能的影响。在《史记》数据集上进行实验的结果表明,相较于注入领域知识前后的OneRel模型,PTBG模型所取得的F1值分别提升了1.64和1.97个百分点。可见,PTBG模型能更好地对中文古籍实体关系进行联合抽取,为低资源的小样本深度学习场景提供了新的研究思路与方法。

来源:2025年第1期

《计算机应用》期刊编辑部

查看计算机应用杂志2025年第1期

联系我们

  • 地址:四川天府新区兴隆街道科智路1369号
  • 电话:028-85224283-803
  • E-mail:bjb@joca.cn

咨询工作人员