国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:曹嘉玲,陈宁,
单位:华东理工大学信息科学与工程学院,上海200237;
关键词:说话人验证,图神经网络,预训练,特征融合,
基金:国家自然科学基金资助项目(61771196);;
近期研究表明,基于大量无标签语音样本训练的预训练模型所提取的特征在说话人验证(SV)任务中表现突出。然而,现有模型尚无法利用帧级特征间的拓扑结构特性对帧级特征进行有效的优化和聚合,并且网络复杂度较高不利于实现实时性;同时,现有模型尚无法充分利用多种输入特征之间的互补性以进一步提升模型的性能。为此,一方面引入图神经网络,利用帧级特征间的拓扑结构特性对帧级特征进行优化;另一方面,构造基于多损失的多特征融合机制以充分利用不同特征之间的互补性进一步提升模型的性能。在VoxCeleb上的实验结果表明,与现有模型相比,该模型GACNPF实现了更低的错误率和时间复杂度;更重要的是,该模型具有很好的灵活性,能够融合任意多种特征,且可被应用于其他基于预训练特征提取的分类任务。
来源:2023年第12期
《计算机应用研究》期刊编辑部