国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:王光,刘宗泽,董浩,姜彦吉,
单位:1.辽宁工程技术大学软件学院,辽宁葫芦岛125105;2.清华大学苏州汽车研究院,江苏苏州215134;
关键词:单样本语音转换,信息扰动,特征解耦,说话人音色泄露,
基金:葫芦岛市科技计划资助项目(2023JH(1)4/02b);;
单样本语音转换的特性是利用单条目标说话人的语音样本即可实现身份的转换,但由于声学特征呈现复杂的相互作用和动态变化,现有方法难以充分将单样本语音中的说话人音色与其他声学特征解耦,导致转换音频在听觉上仍与源说话人的音色特征相似,存在说话人音色泄露情况。为此提出一种融合信息扰动与特征解耦的单样本语音转换模型,即IPFD-VC模型。首先,引入信息扰动模块对语音信号进行三次扰动操作,去除输入内容和韵律编码器中的冗余信息;其次,将处理后的语音信号送入各编码器,并结合最小化互信息策略进一步解耦声学特征,降低不同特征与说话人音色特征的相关性;最后通过解码器及声码器输出转换音频。实验结果表明:IPFD-VC模型转换音频的语音自然度和说话人相似度分别达到3.72和3.68,与目前先进的UUVC模型相比,梅尔倒谱失真降低0.26 dB。该模型能够有效对声学特征进行解耦,捕获目标说话人音色特征,同时保持源语言内容和韵律变化,降低说话人音色泄露风险。
来源:2024年第10期
《计算机应用研究》期刊编辑部