声明
严正声明:本站非期刊官网,非中介代理。
本站仅提供学术规范服务:快速预审、润色编辑服务、中英文查重、降重、去重服务、推荐合适的期刊投稿等学术规范服务。 如需提供学术规范服务请联系在线编辑。
国内刊号:11-2223/N
国际刊号:1000-0054
发布日期:
作者:肖素杰, 黎塔, 郝锐朋, 仁增多杰, 赵庆卫
单位:1. 中国科学院声学研究所 语音与智能信息处理实验室,北京 100190,2. 中国科学院大学,北京 100049,3. 西藏大学 信息科学技术学院,拉萨 850000
关键词:尖峰特征,口音识别,语音识别,多任务学习
基金:新一代人工智能国家科技重大专项项目(2022ZD0116103)
口音是语音识别面临的主要挑战之一,为解决多口音语音识别问题,进一步探索口音识别与语音识别任务之间的相互作用,该文提出一种基于尖峰特征的口音识别和语音识别多任务学习方法。该方法首先通过共享部分编码器底层网络,利用口音信息隐式增强特定口音的声学特征,提升口音语音识别性能;其次,通过分析口音特征可发现,口音特征大部分由空白帧组成,而更能反映口音差异的有效标签帧未发挥主要作用。因此,该文在多任务学习框架下,将有效标签对应的连接主义时序分类(connectionist temporal classification,CTC)尖峰特征作为口音识别的输入特征,从而在一定程度上提升口音识别性能。在英文Common Voice和AESRC2020数据集上的试验结果表明:与直接混合所有数据训练的模型相比,该文方法在语音识别性能上分别绝对提升0.6%和1.0%;在口音识别上,基于CTC尖峰特征的口音识别性能分别绝对提升0.7%和1.9%。
来源:2025年第7期
《清华大学学报(自然科学版)》期刊编辑部
严正声明:本站非期刊官网,非中介代理。
本站仅提供学术规范服务:快速预审、润色编辑服务、中英文查重、降重、去重服务、推荐合适的期刊投稿等学术规范服务。 如需提供学术规范服务请联系在线编辑。