国内刊号:51-1307/TP
国际刊号:1001-9081
发布日期:
作者:申奥, 黄瑞章, 薛菁菁, 陈艳平, 秦永彬
单位:1.贵州大学 文本计算与认知智能教育部工程研究中心,贵阳 550025;2.公共大数据国家重点实验室(贵州大学),贵阳 550025;3.贵州大学 计算机科学与技术学院,贵阳 550025
关键词:深度文本聚类,分布增强,变分自编码器,语义表征,分布一致性约束
基金:国家自然科学基金资助项目(62066007);贵州省科技支撑计划项目(黔科合支撑[2023]一般300)
针对深度变分文本聚类模型在实际应用中遇到的分布信息缺失和分布坍塌问题,提出一种基于分布增强的深度变分文本聚类模型(DVCMD)。该模型通过分布信息增强的方法,整合增强潜在语义分布至原始潜在语义分布,从而提高潜在分布的信息完整性和准确性;同时,采用分布一致性约束策略促使模型学习一致的语义表征,从而提高模型通过学习的语义分布对数据真实信息的表达能力,进而提升聚类性能。实验结果表明,与现有的深度聚类模型和结构语义增强聚类模型相比,DVCMD的归一化互信息(NMI)指标在Abstract、BBC、Reuters-10k和BBCSports这4个真实数据集上分别至少提升了0.16、9.01、2.30和2.72个百分点,验证了模型的有效性。
来源:2025年第8期
《计算机应用》期刊编辑部