声明
严正声明:本站非期刊官网,非中介代理。
本站仅提供学术规范服务:快速预审、润色编辑服务、中英文查重、降重、去重服务、推荐合适的期刊投稿等学术规范服务。 如需提供学术规范服务请联系在线编辑。
国内刊号:51-1307/TP
国际刊号:1001-9081
发布日期:
作者:宋源, 陈锌, 李亚荣, 李永伟, 刘扬, 赵振
单位:1.青岛科技大学 信息科学技术学院,山东 青岛 266061;2.中国科学院自动化研究所 模式识别国家重点实验室,北京 100190
关键词:语音分离,调制机制,孪生网络,协同注意力机制,自组织映射网络
基金:国家自然科学基金青年项目(62201314);山东省自然科学基金青年项目(ZR2020QF007)
为了解决基于语谱图特征输入的单通道语音分离方法存在的不同说话人时频点重叠导致分离效果欠佳的问题,提出一种基于听觉调制孪生网络的单通道语音分离模型。首先,通过频带划分和包络检波计算调制信号,进而利用傅里叶变换提取调制幅度谱;其次,基于突变点检测和匹配的方法获取调制幅度谱特征与语音片段之间的映射关系,实现语音片段的有效划分;再次,设计融合协同注意力机制的孪生神经网络(FCMSNN)提取不同说话人语音片段的鉴别性特征;继次,提出基于邻域机制的自组织映射(N-SOM)网络,通过划定动态邻域范围实现无需预先指定说话人数量的特征聚类,以获得不同说话人的掩膜矩阵;最后,为了避免在调制域重构信号中产生伪影,设计时域滤波器将调制域掩膜转换为时域掩膜并结合相位信息重构语音信号。实验结果表明,所提模型在WSJ0-2mix和WSJ0-3mix数据集上的语音质量感知评价(PESQ)、信号失真比改进(SDRi)和尺度不变信号失真比改进(SI-SDRi)均优于双密度双树复小波变换(DDDTCWT)方法,分别提高了3.47%、6.91%和7.79%和3.08%、6.71%、7.51%。
来源:2025年第6期
《计算机应用》期刊编辑部
严正声明:本站非期刊官网,非中介代理。
本站仅提供学术规范服务:快速预审、润色编辑服务、中英文查重、降重、去重服务、推荐合适的期刊投稿等学术规范服务。 如需提供学术规范服务请联系在线编辑。