国内刊号:51-1307/TP
国际刊号:1001-9081
发布日期:
作者:李婷婷, 吕佳, 范伟亚
单位:1. 重庆师范大学 计算机与信息科学学院, 重庆 401331;2. 重庆市数字农业服务工程技术研究中心(重庆师范大学), 重庆 401331
关键词:正例无标记学习,间谍技术,半监督自训练,聚类,可靠负例,可靠正例
基金:重庆市自然科学基金资助项目(cstc2014jcyjA40011);重庆市教委科技项目(KJ1400513);重庆师范大学科研项目(YKC19018)。
正例无标记(PU)学习中的间谍技术极易受噪声和离群点干扰,导致划分的可靠正例不纯,且在初始正例中随机选择间谍样本的机制极易造成划分可靠负例时效率低下,针对这些问题提出一种结合新型间谍技术和半监督自训练的PU学习框架。首先,该框架对初始有标记样本进行聚类并选取离聚类中心较近的样本来取代间谍样本,这些样本能有效地映射出无标记样本的分布结构,从而更好地辅助选取可靠负例;然后对间谍技术划分后的可靠正例进行自训练提纯,采用二次训练的方式取回被误分为正例样本的可靠负例。该框架有效地解决了传统间谍技术在PU学习中分类效率易受数据分布干扰以及随机间谍样本影响的问题。通过9个标准数据集上的仿真实验结果表明,所提框架的平均分类准确率和F-值均高于基本PU学习算法(Basic_PU)、基于间谍技术的PU学习算法(SPY)、基于朴素贝叶斯的自训练PU学习算法(NBST)和基于迭代剪枝的PU学习算法(Pruning)。
来源:2019年第10期
《计算机应用》期刊编辑部