国内刊号:51-1307/TP
国际刊号:1001-9081
发布日期:
作者:范锦涛, 陈艳平, 杨采薇, 林川
单位:1.文本计算与认知智能教育部工程研究中心(贵州大学),贵阳 550025;2.公共大数据国家重点实验室(贵州大学),贵阳 550025;3.贵州大学 计算机科学与技术学院,贵阳 550025
关键词:对比学习,边界信息,双编码器,标签语义,嵌套命名实体识别
基金:国家重点研发计划项目(2023YFC3304500);国家自然科学基金资助项目(62166007);黔科合重大专项([2024] 003号)
现有对比学习(CL)方法在嵌套命名实体识别(NER)任务中存在以下2个主要缺点:1)枚举生成的候选实体作为对比学习的对象,缺失上下文语义依赖和边界信息;2)产生不必要的噪声和无效信息,增加模型的计算负担且弱化了对比学习的性能,提出一个两阶段命名实体识别框架。在第一阶段,通过边界识别模型生成候选实体边界,并通过边界集成模块生成候选实体,减少不必要的负候选实体的生成;同时,在候选实体两侧插入注意力线索,生成对应的候选实体文本,使得模型能够感知上下文语义和边界信息。在第二阶段,提出一个双编码框架用于识别实体,通过对比学习将候选实体文本和实体类型注释映射到相同向量表征空间中,对比的对象不再是候选实体,而是带有注意力线索的句子。此外,设计带有标签语义的分类参数矩阵,丰富模型对候选实体的理解能力。实验结果表明,与Binder方法相比,所提方法在GENIA、ACE2005和ACE2004这3个嵌套数据集上的F1值分别提升了1.22、3.42和2.31个百分点,验证了所提方法对嵌套NER任务的有效性。
来源:2025年第10期
《计算机应用》期刊编辑部