国内刊号:51-1307/TP
国际刊号:1001-9081
发布日期:
作者:赵威, 林煜明, 黄涛贻, 李优
单位:1. 广西可信软件重点实验室(桂林电子科技大学), 广西 桂林 541004;2. 广西自动检测技术与仪器重点实验室(桂林电子科技大学), 广西 桂林 541004
关键词:观点挖掘,众包计算,成本约束,工作者检测,数据整合
基金:国家自然科学基金资助项目(61562014,U1711263);广西自然科学基金重点项目(2018GXNSFDA281049);桂林电子科技大学研究生优秀学位论文培育项目(16YJPYSS15);桂林电子科技大学研究生教育创新计划项目(2018YJCX48);广西可信软件重点实验室研究课题(kx201916)。
用户评论包含了丰富的用户观点信息,对潜在的顾客和商家具有重要的参考价值。观点目标和观点词作为用户评论中的核心对象,它们的自动抽取是用户评论智能化应用的一项核心工作。目前主要采用有监督的抽取方法解决该问题,这些方法依赖于利用高质量的标注样本进行模型训练,而传统人工标注样本的方法不仅耗时费力,且标注成本高。众包计算为构建高质量训练样本集提供了一种有效途径,然而,众包工作者由于知识背景等因素使得标注结果的质量参差不齐。为了在有限的成本下获取高质量的标注样本,提出一种基于工作者专业水平评估的自适应众包标注方法,构建可靠的观点目标-观点词数据集。首先,通过小成本挖掘出高专业水平的工作者;然后,设计一种基于工作者可靠性的任务分发机制;最后,利用观点目标和观点词间的依赖关系设计了一种有效的标注结果融合算法,通过整合不同工作者的标注结果生成最终可靠的结果。在真实数据集上进行了一系列实验表明,与GLAD模型和多数投票(MV)算法方法相比,所提方法能够在成本预算较小的情况下将构建出的高质量观点目标-观点词数据集的可靠性提高10%左右。
来源:2019年第5期
《计算机应用》期刊编辑部