基于特征增强预训练模型的有效语音检测方法、装置与流程

专利2026-02-12  21


本技术涉及语音处理,特别是涉及一种基于特征增强预训练模型的有效语音检测方法、装置、计算机设备、计算机可读存储介质和计算机程序产品。


背景技术:

1、随着语音识别技术的发展,其在电力生产活动中的应用越来越广泛,如基于电力智能客服平台的语音分析处理。但实际应用环境的复杂性也给语音识别技术带来了严峻挑战。

2、相关技术中,传统的语音识别通常是基于vad(voice activity detection,有效语音检测)技术去除语音中包含的环境噪声。由于实际应用环境中噪声类型复杂且应用场景众多,传统的语音识别方法针对某些噪声难以完全去除,而未去除的噪声对于语音识别系统的性能影响较大。


技术实现思路

1、基于此,有必要针对上述技术问题,提供一种能够提升有效语音检测效果的基于特征增强预训练模型的有效语音检测方法、装置、计算机设备、计算机可读存储介质和计算机程序产品。

2、第一方面,本技术提供了一种基于特征增强预训练模型的有效语音检测方法,包括:

3、获取包含有不同类型的噪声的待检测语音;

4、将所述待检测语音输入至第一预训练模型,通过所述第一预训练模型提取得到所述待检测语音的有效语音特征;所述第一预训练模型所采用的第一训练数据为对无标注样本语音进行数据特征增强得到;

5、将所述有效语音特征输入至第二预训练模型,通过所述第二预训练模型进行有效语音分类,得到分类结果序列;所述第二预训练模型所采用的第二训练数据为对已标注样本语音进行数据特征增强得到;所述分类结果序列用于表征所述待检测语音中每个帧的语音是否为有效语音的概率;

6、根据所述分类结果序列,输出所述待检测语音的有效语音片段;所述有效语音片段为去除所述待检测语音中噪声的语音片段。

7、在其中一个实施例中,所述根据所述分类结果序列,输出所述待检测语音的有效语音片段,包括:

8、在所述分类结果序列中,确定有效语音帧的起始时间点以及结束时间点;

9、根据所述有效语音帧的起始时间点以及结束时间点对应的序列片段,得到所述有效语音片段。

10、在其中一个实施例中,所述方法还包括:

11、获取基于语音识别任务的无标注样本语音;

12、根据所述无标注样本语音转换得到梅尔频谱矩阵,通过在所述梅尔频谱矩阵的时间维度和频率维度进行处理,得到所述无标注样本语音的增强后数据特征;

13、将所述无标注样本语音的增强后数据特征,作为所述第一训练数据。

14、在其中一个实施例中,所述方法还包括:

15、获取基于编码器和解码器结构的第一待训练模型;

16、结合所述第一训练数据和第一损失函数,对所述第一待训练模型进行自监督模型训练,得到用于提取有效语音特征的所述第一预训练模型;所述第一损失函数包括对比损失和多样性损失。

17、在其中一个实施例中,所述方法还包括:

18、获取基于语音识别任务的已标注样本语音,将所述已标注样本语音的增强后数据特征,作为所述第二训练数据;

19、通过将所述第二训练数据输入至所述第一预训练模型进行特征提取处理,得到样本有效语音特征。

20、在其中一个实施例中,所述方法还包括:

21、获取基于神经网络的第二待训练模型;所述第二待训练模型包括有效语音分类模型;

22、采用所述样本有效语音特征作为输入,根据第二损失函数对所述有效语音分类模型进行训练,得到分类结果输出模型;所述第二损失函数包括交叉熵函数;

23、结合所述分类结果输出模型和有效语音片段输出模块,得到所述第二预训练模型。

24、第二方面,本技术还提供了一种基于特征增强预训练模型的有效语音检测装置,包括:

25、待检测语音获取模块,用于获取包含有不同类型的噪声的待检测语音;

26、有效语音特征提取模块,用于将所述待检测语音输入至第一预训练模型,通过所述第一预训练模型提取得到所述待检测语音的有效语音特征;所述第一预训练模型所采用的第一训练数据为对无标注样本语音进行数据特征增强得到;

27、有效语音分类模块,用于将所述有效语音特征输入至第二预训练模型,通过所述第二预训练模型进行有效语音分类,得到分类结果序列;所述第二预训练模型所采用的第二训练数据为对已标注样本语音进行数据特征增强得到;所述分类结果序列用于表征所述待检测语音中每个帧的语音是否为有效语音的概率;

28、有效语音片段输出模块,用于根据所述分类结果序列,输出所述待检测语音的有效语音片段;所述有效语音片段为去除所述待检测语音中噪声的语音片段。

29、第三方面,本技术还提供了一种计算机设备,包括存储器和处理器,所述存储器存储有计算机程序,所述处理器执行所述计算机程序时实现以下步骤:

30、获取包含有不同类型的噪声的待检测语音;

31、将所述待检测语音输入至第一预训练模型,通过所述第一预训练模型提取得到所述待检测语音的有效语音特征;所述第一预训练模型所采用的第一训练数据为对无标注样本语音进行数据特征增强得到;

32、将所述有效语音特征输入至第二预训练模型,通过所述第二预训练模型进行有效语音分类,得到分类结果序列;所述第二预训练模型所采用的第二训练数据为对已标注样本语音进行数据特征增强得到;所述分类结果序列用于表征所述待检测语音中每个帧的语音是否为有效语音的概率;

33、根据所述分类结果序列,输出所述待检测语音的有效语音片段;所述有效语音片段为去除所述待检测语音中噪声的语音片段。

34、第四方面,本技术还提供了一种计算机可读存储介质,其上存储有计算机程序,所述计算机程序被处理器执行时实现以下步骤:

35、获取包含有不同类型的噪声的待检测语音;

36、将所述待检测语音输入至第一预训练模型,通过所述第一预训练模型提取得到所述待检测语音的有效语音特征;所述第一预训练模型所采用的第一训练数据为对无标注样本语音进行数据特征增强得到;

37、将所述有效语音特征输入至第二预训练模型,通过所述第二预训练模型进行有效语音分类,得到分类结果序列;所述第二预训练模型所采用的第二训练数据为对已标注样本语音进行数据特征增强得到;所述分类结果序列用于表征所述待检测语音中每个帧的语音是否为有效语音的概率;

38、根据所述分类结果序列,输出所述待检测语音的有效语音片段;所述有效语音片段为去除所述待检测语音中噪声的语音片段。

39、第五方面,本技术还提供了一种计算机程序产品,包括计算机程序,该计算机程序被处理器执行时实现以下步骤:

40、获取包含有不同类型的噪声的待检测语音;

41、将所述待检测语音输入至第一预训练模型,通过所述第一预训练模型提取得到所述待检测语音的有效语音特征;所述第一预训练模型所采用的第一训练数据为对无标注样本语音进行数据特征增强得到;

42、将所述有效语音特征输入至第二预训练模型,通过所述第二预训练模型进行有效语音分类,得到分类结果序列;所述第二预训练模型所采用的第二训练数据为对已标注样本语音进行数据特征增强得到;所述分类结果序列用于表征所述待检测语音中每个帧的语音是否为有效语音的概率;

43、根据所述分类结果序列,输出所述待检测语音的有效语音片段;所述有效语音片段为去除所述待检测语音中噪声的语音片段。

44、上述一种基于特征增强预训练模型的有效语音检测方法、装置、计算机设备、计算机可读存储介质和计算机程序产品,通过获取包含有不同类型的噪声的待检测语音,然后将待检测语音输入至第一预训练模型,通过第一预训练模型提取得到待检测语音的有效语音特征,该第一预训练模型所采用的第一训练数据为对无标注样本语音进行数据特征增强得到,进而将有效语音特征输入至第二预训练模型,通过第二预训练模型进行有效语音分类,得到分类结果序列,该第二预训练模型所采用的第二训练数据为对已标注样本语音进行数据特征增强得到,该分类结果序列用于表征待检测语音中每个帧的语音是否为有效语音的概率,根据分类结果序列,输出待检测语音的有效语音片段,该有效语音片段为去除待检测语音中噪声的语音片段,实现了对有效语音检测的优化,基于特征增强以预训练模型,可以增强有效语音检测模型的鲁棒性,适应更多的应用场景以及噪声类型,有效提升了有效语音检测效果,能够改善有效语音检测的性能以提升语音识别系统的性能。


技术特征:

1.一种基于特征增强预训练模型的有效语音检测方法,其特征在于,所述方法包括:

2.根据权利要求1所述的方法,其特征在于,所述根据所述分类结果序列,输出所述待检测语音的有效语音片段,包括:

3.根据权利要求1所述的方法,其特征在于,所述方法还包括:

4.根据权利要求1所述的方法,其特征在于,所述方法还包括:

5.根据权利要求1所述的方法,其特征在于,所述方法还包括:

6.根据权利要求5所述的方法,其特征在于,所述方法还包括:

7.一种基于特征增强预训练模型的有效语音检测装置,其特征在于,所述装置包括:

8.一种计算机设备,包括存储器和处理器,所述存储器存储有计算机程序,其特征在于,所述处理器执行所述计算机程序时实现权利要求1至6中任一项所述的方法的步骤。

9.一种计算机可读存储介质,其上存储有计算机程序,其特征在于,所述计算机程序被处理器执行时实现权利要求1至6中任一项所述的方法的步骤。

10.一种计算机程序产品,包括计算机程序,其特征在于,所述计算机程序被处理器执行时实现权利要求1至6中任一项所述的方法的步骤。


技术总结
本申请涉及一种基于特征增强预训练模型的有效语音检测方法、装置。所述方法包括:获取包含有不同类型的噪声的待检测语音;将待检测语音输入至第一预训练模型,通过第一预训练模型提取得到待检测语音的有效语音特征;第一预训练模型所采用的第一训练数据为对无标注样本语音进行数据特征增强得到;将有效语音特征输入至第二预训练模型,通过第二预训练模型进行有效语音分类,得到分类结果序列;根据分类结果序列,输出待检测语音的有效语音片段;有效语音片段为去除待检测语音中噪声的语音片段。采用本方法能够适应更多的应用场景以及噪声类型,有效提升了有效语音检测效果,改善了有效语音检测的性能以提升语音识别系统的性能。

技术研发人员:吴石松,董召杰,李轩昂,梁寿愚,卢志良,陈柔伊,陈骞,赵必美,李紫京,苏立伟,刘振华,赵翔宇,郑桦,李成,冯勤宇
受保护的技术使用者:南方电网人工智能科技有限公司
技术研发日:
技术公布日:2024/12/17
转载请注明原文地址:https://xbbs.6miu.com/read-29677.html