国内刊号:51-1307/TP
国际刊号:1001-9081
发布日期:
作者:伏博毅, 彭云聪, 蓝鑫, 秦小林
单位:1.中国科学院 成都计算机应用研究所,成都 610041;2.中国科学院大学 计算机科学与技术学院,北京 100049
关键词:标签噪声,半监督学习,监督学习,深度学习,损失函数
基金:全国科学院联盟合作项目(中国科学院成都分院-重庆市科学技术研究院);中科院STS区域重点项目(A类)(KFJ-STS-QYZD-2021-21-001);四川省科技计划资助项目(2019ZDZX0006)
在深度学习领域中,大量正确标注的样本对于模型的训练和学习至关重要。然而,在实际的应用场景中,标注数据的成本很高,同时标注的样本质量会受人工标注的主观因素或工具技术的影响,在标注过程中无法避免标签噪声的产生。因此,现有的训练数据都存在一定的标签噪声,如何有效地训练带标签噪声的训练数据成为了研究的热点。围绕基于深度学习的标签噪声学习算法,首先详细阐述了标签噪声学习问题的来源、分类和影响;然后依照机器学习的不同要素分析了基于数据、损失函数、模型、训练方式的四种标签噪声学习策略;随后提供了各种应用场景下学习标签噪声问题的基础框架;最后,给出一些优化思路,并展望了标签噪声学习算法面临的挑战与未来的发展方向。
来源:2023年第3期
《计算机应用》期刊编辑部