音频识别方法、装置、介质和计算设备与流程

专利2026-02-14  21


本公开的实施方式涉及数据处理,更具体地,本公开的实施方式涉及音频识别方法、装置、介质和计算设备。


背景技术:

1、本部分旨在为本公开的实施方式提供背景或上下文。此处的描述不因为包括在本部分中就承认是现有技术。

2、听歌识曲是指当用户听到一段未知的音源时,通过采集该音源来识别并返回对应的歌曲信息(包括歌名、歌手、歌词等)给用户。在相关技术中,在识别时常常通过采集音频数据,提取音频指纹的方式来识别。

3、然而,上述的实现方式过于简易,忽略了音频数据采集时所面对的诸多不稳定因素,从而造成了识别不准确的情况发生。


技术实现思路

1、本公开提供一种音频识别方法、装置、介质和计算设备,以解决相关技术中歌曲识别不准的技术问题。

2、在本公开实施方式的第一方面中,提供了一种音频识别方法,包括:

3、获取终端设备对第一音频进行内录得到的第二音频以及所述终端设备对所述第一音频进行外录得到的第三音频;

4、确定所述终端设备对所述第一音频进行录制的场景信息,所述场景信息包括所述终端设备的设备类型、所述终端设备所处环境的噪声以及所述终端设备播放所述第一音频的音频输出模式中的至少一个;

5、确定所述第二音频的第一音频特征以及所述第三音频的第二音频特征;

6、根据所述场景信息、所述第一音频特征以及所述第二音频特征,确定与所述第一音频所匹配的目标音频,并将所述目标音频的信息确定为所述第一音频的识别信息。

7、在本公开的一个实施例中,所述根据所述场景信息、所述第一音频特征以及所述第二音频特征,确定与所述第一音频所匹配的目标音频,包括:

8、确定所述第一音频特征与存储的第四音频的内录音频特征之间的第一相似度,并确定所述第二音频特征与所述第四音频的外录音频指纹的第二相似度;

9、根据所述场景信息对所述第一相似度配置第一权重,且根据所述场景信息对所述第二相似度配置第二权重;

10、根据所述第一相似度、所述第一权重、所述第二相似度以及所述第二权重,确定所述第一音频与所述第四音频之间的置信度;

11、响应于所述置信度大于预设阈值,将所述第四音频确定为所述目标音频。

12、在本公开的另一实施例中,所述场景信息包括所述噪声以及所述音频输出模式,所述根据所述场景信息对所述第一相似度配置第一权重,且根据所述场景信息对所述第二相似度配置第二权重,包括:

13、确定所述噪声所处的噪声区间;

14、根据所述噪声区间以及所述音频输出模式,对所述第一相似度配置第一权重以及对所述第二相似度配置第二权重。

15、在本公开的又一个实施例中,所述根据所述噪声区间以及所述音频输出模式,对所述第一相似度配置第一权重以及对所述第二相似度配置第二权重,包括:

16、响应于所述噪声区间指示所述终端设备所处环境为低噪声环境,且所述音频输出模式为外放模式,将所述第一权重设置为小于所述第二权重;

17、响应于所述噪声区间指示所述终端设备所处环境为低噪声环境,且所述音频输出模式为耳机模式,将所述第一权重设置为大于所述第二权重;

18、响应于所述噪声区间指示所述终端设备所处环境为低噪声环境,且所述音频输出模式为蓝牙音箱模式,将所述第一权重设置为与所述第二权重相等。

19、在本公开的再一个实施例中,所述根据所述噪声区间以及所述音频输出模式,对所述第一相似度配置第一权重以及对所述第二相似度配置第二权重,包括:

20、响应于所述噪声区间指示所述终端设备所处环境为中噪声环境,且所述音频输出模式为外放模式,将所述第一权重设置为与所述第二权重相等;

21、响应于所述噪声区间指示所述终端设备所处环境为中噪声环境,且所述音频输出模式为耳机模式,将所述第一权重设置为大于所述第二权重;

22、响应于所述噪声区间指示所述终端设备所处环境为中噪声环境,且所述音频输出模式为蓝牙音箱模式,将所述第一权重设置为与所述第二权重相等。

23、在本公开的还一个实施例中,所述根据所述噪声区间以及所述音频输出模式,对所述第一相似度配置第一权重以及对所述第二相似度配置第二权重,包括:

24、响应于所述噪声区间指示所述终端设备所处环境为高噪声环境,将所述第一权重设置为大于所述第二权重。

25、在本公开的还一个实施例中,所述确定所述第一音频特征与存储的第四音频的内录音频特征之间的第一相似度,包括:

26、获取目标参数,所述目标参数包括当前时间段以及所述终端设备所处位置中的至少一个;

27、确定与所述目标参数匹配的音频数据库,并在所述音频数据库中确定存储的第四音频。

28、在本公开的还一个实施例中,所述确定所述第二音频的第一音频特征以及所述第三音频的第二音频特征,包括:

29、获取所述第一音频中的人声的第一占比与非人声的第二占比;

30、根据所述第一占比与所述第二占比,确定音频特征识别策略;

31、采用所述音频特征识别策略,识别所述第二音频的第一音频特征以及所述第三音频的第二音频特征。

32、在本公开的还一个实施例中,所述根据所述第一占比与所述第二占比,确定音频特征识别策略,包括:

33、响应于所述第一占比小于第一预设占比、或所述第一占比小于第二预设占比且所述第二占比大于第三预设占比,将听歌识曲的识别模式确定为所述音频特征识别策略;

34、响应于所述第二占比小于第三预设占比、或所述第二占比不小于所述第三预设占比且所述第一占比不小于第二预设占比,将哼唱识曲的识别模式确定为所述音频特征识别策略。

35、在本公开的还一个实施例中,所述采用所述音频特征识别策略,识别所述第二音频的第一音频特征以及所述第三音频的第二音频特征,包括:

36、响应于所述音频特征识别策略为哼唱识曲的识别模式,采用所述哼唱识曲的识别模式对所述第二音频以及所述第三音频,进行预设时长的识别后,采用歌词识曲的识别模式对所述第二音频以及所述第三音频,得到所述第一音频特征以及所述第二音频特征

37、在本公开的还一个实施例中,所述第二音频与所述第三音频的起始播放时间点相同。

38、在本公开实施方式的第二方面中,提供了一种计算机可读存储介质,所述计算机可读存储介质中存储有计算机执行指令,当处理器执行所述计算机执行指令时,实现如第一方面及任一实施例中所述的方法。

39、在本公开实施方式的第三方面中,提供了一种音频识别装置,包括:

40、获取模块,用于获取终端设备对第一音频进行内录得到的第二音频以及所述终端设备对所述第一音频进行外录得到的第三音频;

41、第一确定模块,用于确定所述终端设备对所述第一音频进行录制的场景信息,所述场景信息包括所述终端设备的设备类型、所述终端设备所处环境的噪声以及所述终端设备播放所述第一音频的音频输出模式中的至少一个;

42、第二确定模块,用于确定所述第二音频的第一音频特征以及所述第三音频的第二音频特征;

43、第三确定模块,用于根据所述场景信息、所述第一音频特征以及所述第二音频特征,确定与所述第一音频所匹配的目标音频,并将所述目标音频的信息确定为所述第一音频的识别信息。

44、在本公开的一个实施例中,所述第三确定模块根据所述场景信息、所述第一音频特征以及所述第二音频特征,确定与所述第一音频所匹配的目标音频,具体用于:

45、确定所述第一音频特征与存储的第四音频的内录音频特征之间的第一相似度,并确定所述第二音频特征与所述第四音频的外录音频指纹的第二相似度;

46、根据所述场景信息对所述第一相似度配置第一权重,且根据所述场景信息对所述第二相似度配置第二权重;

47、根据所述第一相似度、所述第一权重、所述第二相似度以及所述第二权重,确定所述第一音频与所述第四音频之间的置信度;

48、响应于所述置信度大于预设阈值,将所述第四音频确定为所述目标音频。

49、在本公开的另一实施例中,所述场景信息包括所述噪声以及所述音频输出模式,所述第三确定模块根据所述场景信息对所述第一相似度配置第一权重,且根据所述场景信息对所述第二相似度配置第二权重,具体用于:

50、确定所述噪声所处的噪声区间;

51、根据所述噪声区间以及所述音频输出模式,对所述第一相似度配置第一权重以及对所述第二相似度配置第二权重。

52、在本公开的又一个实施例中,所述第三确定模块根据所述噪声区间以及所述音频输出模式,对所述第一相似度配置第一权重以及对所述第二相似度配置第二权重,具体用于:

53、响应于所述噪声区间指示所述终端设备所处环境为低噪声环境,且所述音频输出模式为外放模式,将所述第一权重设置为小于所述第二权重;

54、响应于所述噪声区间指示所述终端设备所处环境为低噪声环境,且所述音频输出模式为耳机模式,将所述第一权重设置为大于所述第二权重;

55、响应于所述噪声区间指示所述终端设备所处环境为低噪声环境,且所述音频输出模式为蓝牙音箱模式,将所述第一权重设置为与所述第二权重相等。

56、在本公开的再一个实施例中,所述第三确定模块根据所述噪声区间以及所述音频输出模式,对所述第一相似度配置第一权重以及对所述第二相似度配置第二权重,具体用于:

57、响应于所述噪声区间指示所述终端设备所处环境为中噪声环境,且所述音频输出模式为外放模式,将所述第一权重设置为与所述第二权重相等;

58、响应于所述噪声区间指示所述终端设备所处环境为中噪声环境,且所述音频输出模式为耳机模式,将所述第一权重设置为大于所述第二权重;

59、响应于所述噪声区间指示所述终端设备所处环境为中噪声环境,且所述音频输出模式为蓝牙音箱模式,将所述第一权重设置为与所述第二权重相等。

60、在本公开的还一个实施例中,所述第三确定模块根据所述噪声区间以及所述音频输出模式,对所述第一相似度配置第一权重以及对所述第二相似度配置第二权重,具体用于:

61、响应于所述噪声区间指示所述终端设备所处环境为高噪声环境,将所述第一权重设置为大于所述第二权重。

62、在本公开的还一个实施例中,所述第三确定模块确定所述第一音频特征与存储的第四音频的内录音频特征之间的第一相似度,具体用于:

63、获取目标参数,所述目标参数包括当前时间段以及所述终端设备所处位置中的至少一个;

64、确定与所述目标参数匹配的音频数据库,并在所述音频数据库中确定存储的第四音频。

65、在本公开的还一个实施例中,所述第二确定模块确定所述第二音频的第一音频特征以及所述第三音频的第二音频特征,具体用于:

66、获取所述第一音频中的人声的第一占比与非人声的第二占比;

67、根据所述第一占比与所述第二占比,确定音频特征识别策略;

68、采用所述音频特征识别策略,识别所述第二音频的第一音频特征以及所述第三音频的第二音频特征。

69、在本公开的还一个实施例中,所述第二确定模块根据所述第一占比与所述第二占比,确定音频特征识别策略,具体用于:

70、响应于所述第一占比小于第一预设占比、或所述第一占比小于第二预设占比且所述第二占比大于第三预设占比,将听歌识曲的识别模式确定为所述音频特征识别策略;

71、响应于所述第二占比小于第三预设占比、或所述第二占比不小于所述第三预设占比且所述第一占比不小于第二预设占比,将哼唱识曲的识别模式确定为所述音频特征识别策略。

72、在本公开的还一个实施例中,所述第二确定模块采用所述音频特征识别策略,识别所述第二音频的第一音频特征以及所述第三音频的第二音频特征,具体用于:

73、响应于所述音频特征识别策略为哼唱识曲的识别模式,采用所述哼唱识曲的识别模式对所述第二音频以及所述第三音频,进行预设时长的识别后,采用歌词识曲的识别模式对所述第二音频以及所述第三音频,得到所述第一音频特征以及所述第二音频特征

74、在本公开的还一个实施例中,所述第二音频与所述第三音频的起始播放时间点相同。

75、在本公开实施方式的第四方面中,提供了一种计算设备,包括:至少一个处理器;

76、以及与所述至少一个处理器通信连接的存储器;

77、其中,所述存储器存储有可被所述至少一个处理器执行的指令,所述指令被所述至少一个处理器执行,以使所述计算设备执行第一方面及任一实施例中所述的方法。

78、根据本公开实施方式的音频识别方法、装置、介质和计算设备,该方法包括:获取终端设备对第一音频进行内录得到的第二音频以及终端设备对第一音频进行外录得到的第三音频;确定终端设备对第一音频进行录制的场景信息;确定第二音频的第一音频特征以及第三音频的第二音频特征;根据场景信息、第一音频特征以及第二音频特征,确定与第一音频所匹配的目标音频,并将目标音频的信息确定为第一音频的识别信息。本技术方案中,通过对内录和外录音频的音频特征处理和场景信息的综合使用,生成更高质量和一致性的音频指纹,极大地提升了听歌识曲功能的识别率,为用户带来了更好的体验。


技术特征:

1.一种音频识别方法,其特征在于,包括:

2.根据权利要求1所述的音频识别方法,其特征在于,所述根据所述场景信息、所述第一音频特征以及所述第二音频特征,确定与所述第一音频所匹配的目标音频,包括:

3.根据权利要求2所述的音频识别方法,其特征在于,所述场景信息包括所述噪声以及所述音频输出模式,所述根据所述场景信息对所述第一相似度配置第一权重,且根据所述场景信息对所述第二相似度配置第二权重,包括:

4.根据权利要求3所述的音频识别方法,其特征在于,所述根据所述噪声区间以及所述音频输出模式,对所述第一相似度配置第一权重以及对所述第二相似度配置第二权重,包括:

5.根据权利要求3所述的音频识别方法,其特征在于,所述根据所述噪声区间以及所述音频输出模式,对所述第一相似度配置第一权重以及对所述第二相似度配置第二权重,包括:

6.根据权利要求3所述的音频识别方法,其特征在于,所述根据所述噪声区间以及所述音频输出模式,对所述第一相似度配置第一权重以及对所述第二相似度配置第二权重,包括:

7.根据权利要求2所述的音频识别方法,其特征在于,所述确定所述第一音频特征与存储的第四音频的内录音频特征之间的第一相似度,包括:

8.一种音频识别装置,其特征在于,包括:

9.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质中存储有计算机执行指令,当处理器执行所述计算机执行指令时,实现如权利要求1至7中任一项所述的方法。

10.一种计算设备,其特征在于,包括:


技术总结
本公开的实施方式提供了一种音频识别方法,涉及数据处理技术领域。该音频识别方法包括:获取终端设备对第一音频进行内录得到的第二音频以及终端设备对第一音频进行外录得到的第三音频;确定终端设备对第一音频进行录制的场景信息;确定第二音频的第一音频特征以及第三音频的第二音频特征;根据场景信息、第一音频特征以及第二音频特征,确定与第一音频所匹配的目标音频,并将目标音频的信息确定为第一音频的识别信息。通过对内录和外录音频的音频特征处理和场景信息的综合使用,生成更高质量和一致性的音频指纹,极大地提升了听歌识曲功能的识别率,为用户带来了更好的体验。此外,本公开的实施方式提供了一种音频识别装置、介质和计算设备。

技术研发人员:朱双淼,许崝,邵显根,汪泽华,潘颂声,李鹏,陈苗荣,佘锦鑫,陈锦海
受保护的技术使用者:杭州网易云音乐科技有限公司
技术研发日:
技术公布日:2024/12/17
转载请注明原文地址:https://xbbs.6miu.com/read-29732.html