国内刊号:51-1307/TP
国际刊号:1001-9081
发布日期:
作者:何玉林, 李旭, 贺颖婷, 崔来中, 黄哲学
单位:1.人工智能与数字经济广东省实验室(深圳),广东 深圳 518107;2.深圳大学 计算机与软件学院,广东 深圳 518060
关键词:无监督学习,集成学习,子空间学习,最大均值差异,高斯混合模型
基金:广东省自然科学基金面上项目(2023A1515011667);深圳市科技重大专项(KJZD20230923114809020);广东省基础与应用基础研究基金粤深联合基金重点项目(2023B1515120020);深圳市基础研究重点项目(JCYJ20220818100205012)
针对高斯混合模型(GMM)聚类算法在处理大规模高维数据聚类时出现的性能受限和参数敏感的问题,提出一种基于最大均值差异(MMD)的子空间GMM聚类集成(SGMM-CE)算法。首先,对原始大规模高维数据集进行随机样本划分(RSP)以得到多个数据子集,从样本量的角度缩小聚类问题的规模;其次,根据特征对最优GMM构件数的影响,在每一个数据子集对应的高维特征空间中进行子空间学习,得到每个高维特征空间对应的多个低维特征子空间,并在各个子空间上进行GMM聚类,从而得到一系列异构的GMM;再次,利用所提出的平均共享隶属概率(ASAP),重标记与融合来自同一个数据子集的不同特征子空间上的聚类结果;最后,利用扩展的子空间MMD(SubMMD)作为不同数据子集的聚类结果中2个簇之间的分布一致性的度量准则,据此重标记并融合这些数据子集的聚类结果,进而得到原始数据集的最终聚类集成结果。通过详尽的实验验证SGMM-CE算法的有效性,实验结果显示,相较于对比算法中最好的元簇聚类算法(MCLA),SGMM-CE算法在选用的数据集上的平均标准化互信息(NMI)、聚类精度(CA)和调整兰德系数(ARI)值分别提升了19%,20%和52%。此外,可行性和合理性的实验结果证实了SGMM-CE算法的参数收敛性与时间高效性,表明该算法具备高效处理大规模高维数据聚类问题的能力。
来源:2025年第6期
《计算机应用》期刊编辑部