国内刊号:51-1307/TP
国际刊号:1001-9081
发布日期:
作者:赖华, 孙童, 王文君, 余正涛, 高盛祥, 董凌
单位:1.昆明理工大学 信息工程与自动化学院,昆明 650500;2.云南省人工智能重点实验室(昆明理工大学),昆明 650500
关键词:语音识别,标点恢复,越南语,BERT,多模态
基金:国家自然科学基金资助项目(61732005);云南高新技术产业发展项目(201606);云南省重大科技专项(202103AA080015);云南省基础研究计划项目(202001AS070014);云南省学术和技术带头人后备人才(202105AC160018)
越南语语音识别系统输出的文本序列缺少标点符号,恢复识别文本标点有助于消除歧义,更易于阅读和理解。越南语语音识别文本中常出现破坏语义的错误音节,基于文本模态的标点恢复模型在识别带噪文本时存在标点预测不准确的问题。利用越南语语音中的语气停顿及声调变化指导模型对带噪文本作出正确的标点预测,提出多模态特征的越南语语音识别文本标点恢复方法,利用梅尔倒谱系数(MFCC)提取语音特征,利用预训练语言模型提取文本上下文特征,基于标签注意力机制实现语音与文本多模态特征融合,增强模型对越南语带噪文本上下文信息的学习能力。实验结果表明,相较于基于Transformer和BERT提取文本单一模态特征的标点恢复模型,所提方法在越南语数据集上精确率、召回率和F1值均至少提高10个百分点,验证了融合语音与文本特征对提升越南语语音识别带噪文本标点预测精确率的有效性。
来源:2024年第2期
《计算机应用》期刊编辑部