计算机应用

北大核心,INSPEC,JST,Pж(AJ),CSCD扩展版

国内刊号:51-1307/TP

国际刊号:1001-9081

计算机应用杂志2022年第4期:知识图谱增强的科普文本分类模型

发布日期:

作者:唐望径, 许斌, 仝美涵, 韩美奂, 王黎明, 钟琦

单位:1.清华大学 计算机科学与技术系,北京 100084;2.北京交通大学 计算机与信息技术学院,北京 100044;3.清华大学 深圳国际研究生院,广东 深圳 518055;4.中国科普研究所,北京 100081

关键词:科普文本分类,知识图谱,两级筛选,长文本分类,注意力

科普文本分类是将科普文章按照科普分类体系进行划分的任务。针对科普文章篇幅超过千字,模型难以聚焦关键信息,造成传统模型分类性能不佳的问题,提出一种结合知识图谱进行两级筛选的科普长文本分类模型,来减少主题无关信息的干扰,提升模型的分类性能。首先,采用四步法构建科普领域的知识图谱;然后,将该知识图谱作为距离监督器,并通过训练句子过滤器来过滤掉无关信息;最后,使用注意力机制对过滤后的句子集做进一步的信息筛选,并实现基于注意力的主题分类模型。在所构建的科普文本分类数据集(PSCD)上的实验结果表明,基于领域知识图谱的知识增强的文本分类算法模型具有更高的F1-Score,相较于TextCNN模型和BERT模型,在F1-Score上分别提升了2.88个百分点和1.88个百分点,验证了知识图谱对于长文本信息筛选的有效性。

来源:2022年第4期

《计算机应用》期刊编辑部

查看计算机应用杂志2022年第4期

联系我们

  • 地址:四川天府新区兴隆街道科智路1369号
  • 电话:028-85224283-803
  • E-mail:bjb@joca.cn

咨询工作人员