基于块掩蔽的流式语音转换方法与流程

专利2026-02-12  15


本申请涉及计算机,特别是涉及一种基于块掩蔽的流式语音转换方法、装置、计算机设备、计算机可读存储介质和计算机程序产品。


背景技术:

1、语音转换(voice conversion, vc)是一种目的是改变说话人的身份而不改变语言内容的技术手段,广泛应用于语音编码和语音输出设备中,语音转换可以在保证语言内容不变的情况下,将源语音的语音风格(如说话人身份、韵律、情绪等)转换至目标风格,从而实现说话人身份的转换。

2、传统技术中主要通过离线训练完成的语音转换模型进行在线的语音转换,然而,传统技术采用离线训练在线推理的方案存在训练和推理不同步的问题,离线训练时的数据与实际推理过程中的数据的特征或类型不一致,离线训练的模型有可能将与说话人有关的信息作为语音内容的一部分,导致语音转换结果不佳,不利于提高语音转换的准确率。


技术实现思路

1、基于此,有必要针对上述技术问题,提供一种能够提高语音转换的准确率的基于块掩蔽的流式语音转换方法、装置、计算机设备、计算机可读存储介质和计算机程序产品。

2、第一方面,本申请提供了一种基于块掩蔽的流式语音转换方法,包括:

3、按照预设窗长对待转换语音进行划分,得到至少一个语音片段,并根据所述语音片段确定所述待转换语音的块掩蔽信息;

4、通过流式编码器根据所述块掩蔽信息和所述待转换语音,确定所述待转换语音对应的语音内容信息;所述语音内容信息与所述待转换语音对应的语音对象身份信息无关;

5、通过流式解码器根据目标语音对象身份信息对所述语音内容信息进行解码,得到所述待转换语音对应的转换后语音。

6、在其中一个实施例中,所述根据所述语音片段确定所述待转换语音的块掩蔽信息,包括:

7、根据所述预设窗长从所述语音片段中筛选出待掩蔽片段,根据所述待掩蔽片段确定块级别掩码信息;

8、将所述语音片段中除所述待掩蔽片段以外的语音片段作为动态掩蔽片段,根据所述动态掩蔽片段确定动态分布掩码信息;

9、根据所述块级别掩码信息和所述动态分布掩码信息,确定所述块掩蔽信息。

10、在其中一个实施例中,所述通过流式编码器根据所述块掩蔽信息和所述待转换语音,确定所述待转换语音对应的语音内容信息,包括:

11、通过所述流式编码器根据所述流式编码器的长度掩蔽信息和所述块掩蔽信息,确定所述待转换语音对应的掩蔽信息;

12、通过所述流式编码器根据所述流式编码器对应的注意力权重矩阵和所述掩蔽信息,确定注意力权重信息;

13、根据所述注意力权重信息和所述待转换语音,确定所述待转换语音对应的语音内容信息。

14、在其中一个实施例中,所述方法还包括:

15、通过所述流式编码器获取所述待转换语音中第一语音片段对应的语音内容信息;

16、将所述第一语音片段对应的语音内容信息作为缓存数据,并将所述缓存数据与所述待转换语音中第二语音片段进行拼接,得到拼接结果;所述第二语音片段在所述待转换语音中的位置前于所述第一语音片段;

17、通过所述流式编码器根据所述第二语音片段和所述拼接结果,确定所述第二语音片段对应的语音内容信息。

18、在其中一个实施例中,所述通过流式解码器根据目标语音对象身份信息对所述语音内容信息进行解码,得到所述待转换语音对应的转换后语音,包括:

19、通过所述流式解码器根据所述目标语音对象身份信息对所述语音内容信息进行解码,得到所述待转换语音对应的解码结果;

20、获取所述解码结果对应的语音对象身份分类结果;

21、在所述语音对象身份分类结果与所述目标语音对象身份信息相匹配的情况下,将所述解码结果转换为所述待转换语音对应的转换后语音。

22、在其中一个实施例中,所述方法还包括:

23、获取第一样本语音和第二样本语音;所述第一样本语音和所述第二样本语音具有相同的语音内容;所述第一样本语音的语音对象身份信息和所述第二样本语音的语音对象身份信息不同;

24、根据所述第一样本语音和所述第二样本语音对所述流式编码器和所述流式解码器进行训练。

25、第二方面,本申请还提供了一种基于块掩蔽的流式语音转换装置,包括:

26、信息获取模块,用于按照预设窗长对待转换语音进行划分,得到至少一个语音片段,并根据所述语音片段确定所述待转换语音的块掩蔽信息;

27、内容分析模块,用于通过流式编码器根据所述块掩蔽信息和所述待转换语音,确定所述待转换语音对应的语音内容信息;所述语音内容信息与所述待转换语音对应的语音对象身份信息无关;

28、语音解码模块,用于通过流式解码器根据目标语音对象身份信息对所述语音内容信息进行解码,得到所述待转换语音对应的转换后语音。

29、第三方面,本申请还提供了一种计算机设备。所述计算机设备包括存储器和处理器,所述存储器存储有计算机程序,所述计算机程序被处理器执行时实现上述的方法的步骤。

30、第四方面,本申请还提供了一种计算机可读存储介质。所述计算机可读存储介质,其上存储有计算机程序,所述计算机程序被处理器执行时实现上述的方法的步骤。

31、第五方面,本申请还提供了一种计算机程序产品。所述计算机程序产品,包括计算机程序,所述计算机程序被处理器执行时实现上述的方法的步骤。

32、上述基于块掩蔽的流式语音转换方法、装置、计算机设备、计算机可读存储介质和计算机程序产品,通过按照预设窗长对待转换语音进行划分,得到至少一个语音片段,并根据语音片段确定待转换语音的块掩蔽信息,从而按照预设窗长逐步分析待转换语音,获取准确的块掩蔽信息;通过流式编码器根据块掩蔽信息和待转换语音,确定待转换语音对应的语音内容信息,从而在块掩蔽信息的基础上,分析待转换语音中与说话人无关的特性信息,得到与待转换语音对应的语音对象身份信息无关的语音内容信息;通过流式解码器根据目标语音对象身份信息对语音内容信息进行解码,得到待转换语音对应的转换后语音,从而结合目标语音对象身份信息解码语音内容信息,得到以目标语音对象身份信息为说话人的转换后语音,能够基于块掩蔽和流式编解码器,采用掩蔽的方式,减少与说话人有关的信息对编码过程的影响,避免与说话人有关的信息被采纳,从而提高语音转换的准确率。



技术特征:

1.一种基于块掩蔽的流式语音转换方法,其特征在于,所述方法包括:

2.根据权利要求1所述的方法,其特征在于,所述根据所述语音片段确定所述待转换语音的块掩蔽信息,包括:

3.根据权利要求1所述的方法,其特征在于,所述通过流式编码器根据所述块掩蔽信息和所述待转换语音,确定所述待转换语音对应的语音内容信息,包括:

4.根据权利要求3所述的方法,其特征在于,所述方法还包括:

5.根据权利要求1所述的方法,其特征在于,所述通过流式解码器根据目标语音对象身份信息对所述语音内容信息进行解码,得到所述待转换语音对应的转换后语音,包括:

6.根据权利要求1所述的方法,其特征在于,所述方法还包括:

7.一种基于块掩蔽的流式语音转换装置,其特征在于,所述装置包括:

8.一种计算机设备,包括存储器和处理器,所述存储器存储有计算机程序,其特征在于,所述处理器执行所述计算机程序时实现权利要求1至6中任一项所述的方法的步骤。

9.一种计算机可读存储介质,其上存储有计算机程序,其特征在于,所述计算机程序被处理器执行时实现权利要求1至6中任一项所述的方法的步骤。

10.一种计算机程序产品,包括计算机程序,其特征在于,所述计算机程序被处理器执行时实现权利要求1至6中任一项所述的方法的步骤。


技术总结
本申请涉及一种基于块掩蔽的流式语音转换方法。所述方法包括:按照预设窗长对待转换语音进行划分,得到至少一个语音片段,并根据语音片段确定待转换语音的块掩蔽信息;通过流式编码器根据块掩蔽信息和待转换语音,确定待转换语音对应的语音内容信息;语音内容信息与待转换语音对应的语音对象身份信息无关;通过流式解码器根据目标语音对象身份信息对语音内容信息进行解码,得到待转换语音对应的转换后语音。采用本方法能够基于块掩蔽和流式编解码器,采用掩蔽的方式,减少与说话人有关的信息对编码过程的影响,避免与说话人有关的信息被采纳,从而提高语音转换的准确率。

技术研发人员:吴石松,卢志良,陈柔伊,董召杰,李轩昂,梁寿愚,任正国,梁凌宇,赵翔宇,王鹏凯,郑桦,李成,李晋伟,陈骞,林全郴
受保护的技术使用者:南方电网人工智能科技有限公司
技术研发日:
技术公布日:2024/12/17
转载请注明原文地址:https://xbbs.6miu.com/read-29686.html