本发明涉及语音编码,特别涉及一种可变比特率的去冗余语音语义编码方法及装置。
背景技术:
1、相关技术中,基于dnn(deep neural network,深度神经网络)的语音语义编码算法,大多将语音波形经过卷积层进行非线性变换后,进行向量量化,此类方法的目的是将语音信号中的不相关分量,通过纯深度神经网络方法分离,其中,深度神经网络要求一定的训练规模,以进行基于深度神经网络的语音语义编码。
2、然而,相关技术中获取的语音语义编码的去冗余程度受模型规模的限制,并且现有的声音合成模型为固定参数的预训练模型,难以根据不同说话人更改恢复语音中的说话人特征,导致部分语音信息失真,降低了语音识别的质量和效率,并且降低了语音恢复的准确性,亟待解决。
技术实现思路
1、本发明提供一种可变比特率的去冗余语音语义编码方法及装置,以解决相关技术中获取的语音语义编码的去冗余程度受模型规模的限制,并且现有的声音合成模型为固定参数的预训练模型,难以根据不同说话人更改恢复语音中的说话人特征,导致部分语音信息失真,降低了语音识别的质量和效率,并且降低了语音恢复的准确性的问题。
2、本发明第一方面实施例提供一种可变比特率的去冗余语音语义编码方法,包括以下步骤:基于预设深度神经网络模型,获取目标说话人的原音频;提取所述原音频中语言学离散语义表示,并获取所述原音频的声纹特征和压缩频谱特征;将所述语言学离散语义表示、所述声纹特征和所述压缩频谱特征分别进行重建处理,得到目标音频声学中间表示,并利用所述目标音频声学中间表示得到要输出的目标音频,以对所述原音频进行去冗余语音语义编码。
3、可选地,在本发明的一个实施例中,所述提取所述原音频的语言学离散语义表示,包括:获取所述原音频对应的语音信号的特征向量;利用所述特征向量获取所述语言学编码,以提取所述语言学编码对应的语言学离散语义表示。
4、可选地,在本发明的一个实施例中,所述语音信号表示为:
5、
6、其中,h(t)为语音信号,gw为唇齿舌滤波器组,f(t)为基础波形,gr为声带和共鸣滤波器组,nr为声带和共鸣滤波器数量,nw为唇齿舌滤波器数量,i为唇齿舌滤波器编号,j为声带和共鸣滤波器编号。
7、可选地,在本发明的一个实施例中,所述获取所述原音频的声纹特征和压缩频谱特征,包括:将所述原音频对应的语音波形转化为表征声学特征的梅尔频谱;提取所述梅尔频谱对应的声学信息潜在编码;利用所述声学信息潜在编码获取声纹特征编码,以利用所述声纹特征编码得到所述声纹特征;基于所述声学信息潜在编码,获取对应的压缩频谱编码,以利用所述压缩频谱编码得到所述压缩频谱特征。
8、可选地,在本发明的一个实施例中,所述将所述语言学离散语义表示、所述声纹特征和所述压缩频谱特征分别进行重建处理,得到目标音频声学中间表示,包括:将所述语言学离散语义表示进行重建处理,得到语义嵌入;将所述声纹特征进行重建处理,得到声纹嵌入;将所述压缩频谱特征进行重建处理,得到频谱嵌入;利用所述语义嵌入、所述声纹嵌入、所述频谱嵌入和目标时间步的梅尔频谱进行加法聚合,得到聚合后的嵌入向量;将所述聚合后的嵌入向量转换为当前时间步的梅尔频谱;拼接所述目标时间步的梅尔频谱和所述当前时间步的梅尔频谱,以获取所述目标音频声学中间表示。
9、本发明第二方面实施例提供一种可变比特率的去冗余语音语义编码装置,包括:获取模块,用于基于预设深度神经网络模型,获取目标说话人的原音频;确定模块,用于提取所述原音频中语言学离散语义表示,并获取所述原音频的声纹特征和压缩频谱特征;处理模块,用于将所述语言学离散语义表示、所述声纹特征和所述压缩频谱特征分别进行重建处理,得到目标音频声学中间表示,并利用所述目标音频声学中间表示得到要输出的目标音频,以对所述原音频进行去冗余语音语义编码。
10、可选地,在本发明的一个实施例中,所述确定模块包括:第一获取单元,用于获取所述原音频对应的语音信号的特征向量;第一提取单元,用于利用所述特征向量获取所述语言学编码,以提取所述语言学编码对应的语言学离散语义表示。
11、可选地,在本发明的一个实施例中,所述语音信号表示为:
12、
13、其中,h(t)为语音信号,gw为唇齿舌滤波器组,f(t)为基础波形,gr为声带和共鸣滤波器组,nr为声带和共鸣滤波器数量,nw为唇齿舌滤波器数量,i为唇齿舌滤波器编号,j为声带和共鸣滤波器编号。
14、可选地,在本发明的一个实施例中,所述确定模块包括:转化单元,用于将所述原音频对应的语音波形转化为表征声学特征的梅尔频谱;第二提取单元,用于提取所述梅尔频谱对应的声学信息潜在编码;第二获取单元,用于利用所述声学信息潜在编码获取声纹特征编码,以利用所述声纹特征编码得到所述声纹特征;第一确定单元,用于基于所述声学信息潜在编码,获取对应的压缩频谱编码,以利用所述压缩频谱编码得到所述压缩频谱特征。
15、可选地,在本发明的一个实施例中,所述处理模块包括:第一处理单元,用于将所述语言学离散语义表示进行重建处理,得到语义嵌入;第二处理单元,用于将所述声纹特征进行重建处理,得到声纹嵌入;第三处理单元,用于将所述压缩频谱特征进行重建处理,得到频谱嵌入;第二确定单元,用于利用所述语义嵌入、所述声纹嵌入、所述频谱嵌入和目标时间步的梅尔频谱进行加法聚合,得到聚合后的嵌入向量;第四处理单元,用于将所述聚合后的嵌入向量转换为当前时间步的梅尔频谱;第三获取单元,拼接所述目标时间步的梅尔频谱和所述当前时间步的梅尔频谱,以获取所述目标音频声学中间表示。
16、本发明第三方面实施例提供一种电子设备,包括:存储器、处理器及存储在所述存储器上并可在所述处理器上运行的计算机程序,所述处理器执行所述程序,以实现如上述实施例所述的可变比特率的去冗余语音语义编码方法。
17、本发明第四方面实施例提供一种计算机可读存储介质,所述计算机可读存储介质存储计算机程序,该程序被处理器执行时实现如上的可变比特率的去冗余语音语义编码方法。
18、本发明第五方面实施例提供一种计算机程序产品,包括计算机程序,所述计算机程序被执行时,以用于实现如上的可变比特率的去冗余语音语义编码方法。
19、本发明实施例可以基于深度神经网络模型,将原音频中获取的语言学离散语义表示、声纹特征和压缩频谱特征分别进行重建处理,得到目标音频声学中间表示,并利用目标音频声学中间表示得到要输出的目标音频,以对原音频进行去冗余语音语义编码,有效的提升了语音识别的质量和效率,并且提升了降低了语音恢复的准确性。由此,解决了相关技术中获取的语音语义编码的去冗余程度受模型规模的限制,并且现有的声音合成模型为固定参数的预训练模型,难以根据不同说话人更改恢复语音中的说话人特征,导致部分语音信息失真,降低了语音识别的质量和效率,并且降低了语音恢复的准确性的问题。
20、本发明附加的方面和优点将在下面的描述中部分给出,部分将从下面的描述中变得明显,或通过本发明的实践了解到。
1.一种可变比特率的去冗余语音语义编码方法,其特征在于,包括以下步骤:
2.根据权利要求1所述的可变比特率的去冗余语音语义编码方法,其特征在于,所述提取所述原音频的语言学离散语义表示,包括:
3.根据权利要求2所述的可变比特率的去冗余语音语义编码方法,其特征在于,所述语音信号表示为:
4.根据权利要求1所述的可变比特率的去冗余语音语义编码方法,其特征在于,所述获取所述原音频的声纹特征和压缩频谱特征,包括:
5.根据权利要求1所述的可变比特率的去冗余语音语义编码方法,其特征在于,所述将所述语言学离散语义表示、所述声纹特征和所述压缩频谱特征分别进行重建处理,得到目标音频声学中间表示,包括:
6.一种可变比特率的去冗余语音语义编码装置,其特征在于,包括:
7.根据权利要求6所述的可变比特率的去冗余语音语义编码装置,其特征在于,所述确定模块包括:
8.一种电子设备,其特征在于,包括:存储器、处理器及存储在所述存储器上并可在所述处理器上运行的计算机程序,所述处理器执行所述程序,以实现如权利要求1-5任一项所述的可变比特率的去冗余语音语义编码方法。
9.一种计算机可读存储介质,其上存储有计算机程序,其特征在于,该程序被处理器执行,以用于实现如权利要求1-5任一项所述的可变比特率的去冗余语音语义编码方法。
10.一种计算机程序产品,包括计算机程序,其特征在于,该计算机程序被处理器执行,以用于实现如权利要求1-5任一项所述的可变比特率的去冗余语音语义编码方法。
