国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:胡从刚,申艺翔,孙永奇,赵思聪,
单位:1.交通大数据与人工智能教育部重点实验室,北京100044;2.北京交通大学计算机与信息技术学院,北京100044;3.北京航天晨信科技有限责任公司,北京102308;
关键词:语音识别,Conformer,RepVGG,压缩和激励网络,
基金:科技创新2030——“新一代人工智能”重大资助项目(2021ZD0113002);;
针对Conformer编码器的声学输入网络对FBank语音信息提取不足和通道特征信息缺失问题,提出一种RepVGG-SE-Conformer的端到端语音识别方法。首先,利用RepVGG的多分支结构,增强模型的语音信息提取能力,而在模型推理时通过结构重参数化将多分支融合为单分支,以降低计算复杂度、加快模型推理速度。然后,利用基于压缩和激励网络的通道注意力机制弥补缺失的通道特征信息,以提高语音识别准确率。最后,在公开数据集Aishell-1上的实验结果表明:相较于Conformer,所提出方法的字错误率降低了10.67%,验证了方法的先进性。此外,RepVGG-SE声学输入网络能够有效提高多种Transformer变体的端到端语音识别模型的整体性能,具有很好的泛化能力。
来源:2024年第7期
《计算机应用研究》期刊编辑部