国内刊号:51-1307/TP
国际刊号:1001-9081
发布日期:
作者:李旭, 何玉林, 崔来中, 黄哲学, PHILIPPE Fournier‑Viger
单位:1.人工智能与数字经济广东省实验室(深圳),广东 深圳 518107;2.深圳大学 计算机与软件学院,广东 深圳 518060
关键词:大数据分类,分布式文件系统,随机样本划分,观测点分类器,Spark计算框架
基金:国家自然科学基金资助项目(61972261);广东省自然科学基金资助项目(2023A1515011667);深圳市基础研究项目(JCYJ20220818100205012)
观测点分类器(OPC)是一种试图通过将多维样本空间线性不可分问题转换成一维距离空间线性可分问题的有监督学习模型,对高维数据的分类问题尤为有效。针对OPC在处理大数据分类问题时表现的较高训练复杂度,在Spark框架下设计一款基于大数据的随机样本划分(RSP)的分布式OPC(DOPC)。首先,在分布式计算环境下生成大数据的RSP数据块,并将它转换为弹性分布式数据集(RDD);其次,在RSP数据块上协同式地训练一组OPC,由于每个RSP数据块上的OPC独立训练,因此有高效的Spark可实现性;最后,在Spark框架下将在RSP数据块上协同训练的OPC集成为DOPC,对新样本进行类标签预测。在8个大数据集上,对Spark集群环境下实现的DOPC的可行性、合理性和有效性进行实验验证,实验结果显示,DOPC能够以更低的计算消耗获得比单机OPC更高的测试精度,同时相较于Spark框架下实现的基于RSP模型的神经网络(NN)、决策树(DT)、朴素贝叶斯(NB)和K最近邻(KNN),DOPC分类器具有更强的泛化性能。测试结果表明,DOPC是一种高效低耗的处理大数据分类问题的有监督学习算法。
来源:2024年第6期
《计算机应用》期刊编辑部