国内刊号:51-1307/TP
国际刊号:1001-9081
发布日期:
作者:张克君, 李伟男, 钱榕, 史泰猛, 焦萌
单位:1. 北京电子科技学院 计算机科学与技术系, 北京 100070;2. 西安电子科技大学 计算机科学与技术学院, 西安 710071
关键词:自然语言处理,生成式文本自动摘要,序列映射,自编码器,词向量,循环神经网络
基金:国家重点研发计划项目(2018YFB1004101)。
针对自然语言处理(NLP)生成式自动摘要领域的语义理解不充分、摘要语句不通顺和摘要准确度不够高的问题,提出了一种新的生成式自动摘要解决方案,包括一种改进的词向量生成技术和一个生成式自动摘要模型。改进的词向量生成技术以Skip-Gram方法生成的词向量为基础,结合摘要的特点,引入词性、词频和逆文本频率三个词特征,有效地提高了词语的理解;而提出的Bi-MulRnn+生成式自动摘要模型以序列映射(seq2seq)与自编码器结构为基础,引入注意力机制、门控循环单元(GRU)结构、双向循环神经网络(BiRnn)、多层循环神经网络(MultiRnn)和集束搜索,提高了生成式摘要准确性与语句流畅度。基于大规模中文短文本摘要(LCSTS)数据集的实验结果表明,该方案能够有效地解决短文本生成式摘要问题,并在Rouge标准评价体系中表现良好,提高了摘要准确性与语句流畅度。
来源:2019年第2期
《计算机应用》期刊编辑部