本发明涉及智能客服领域,尤其涉及一种融合大语言模型和知识图谱的智能答复方法以及装置。
背景技术:
1、一种融合大语言模型和知识图谱的智能答复系统是一种将结构化的知识表示(如知识图谱)与自然语言处理技术(如大语言模型)相结合的方法,以提供更准确、更相关的答案给用户。知识图谱能够提供精确的事实信息和实体间的关系,而大语言模型则擅长理解和生成自然语言,两者共同作用可以提高问答系统的性能。
2、目前虽然知识图谱与大语言模型进行结合可以一定程度对回答准确率进行提高,但面对较复杂的问题时,难以从多个方面多个维度回答问题。因此,如何进一步提高大语言模型的回答准确率是亟待解决的问题。
技术实现思路
1、本发明通过提供了一种融合大语言模型和知识图谱的智能答复方法以及装置,解决了现有技术中大语言模型的命中率较低的技术问题,实现了提高大语言模型的回答准确率的技术效果。
2、第一方面,本发明提供了一种融合大语言模型和知识图谱的智能答复方法,方法包括:
3、获取目标用户的第一提问,并判断目标用户是否存在第二提问,第一提问为当前提问,第二提问为第一提问之前的上一提问;
4、若不存在,则基于预设大语言模型获取第一提问的答复;若存在,则判断第一提问与第二提问之间的时间间隔是否在第一预设时长内;
5、若不在,则基于预设大语言模型获取第一提问的答复;若在,则基于预设大语言模型分别提取第一提问的第一关键词集与第二提问的第二关键词集;
6、判断第一关键词集与第二关键词集之间的关键词重复率是否大于重复率阈值;
7、若不大于,则基于预设大语言模型获取第一提问的答复;若大于,则根据第一关键词集与第二关键词集构建若干检索查询语句,并从预设知识图谱数据库中筛选出目标知识图谱;
8、基于若干检索查询语句在目标知识图谱中进行检索后,得到若干第一检索结果,并以若干第一检索结果对预设提示词结构框架进行填充,得到第一文本,预设提示词结构框架包括:背景介绍、辅助信息、答复格式以及核心问题;
9、将第一提问填充至第一文本中,得到第二文本;
10、将第二文本输入预设大语言模型中,得到目标用户的第一提问对应的目标答复。
11、进一步地,从预设知识图谱数据库中筛选出目标知识图谱,包括:
12、从预设知识图谱数据库中,确定每张知识图谱的图谱得分;
13、根据若干图谱得分,对知识图谱进行降序排序,并将预设排名阈值之前的知识图谱均作为目标知识图谱。
14、进一步地,确定预设知识图谱数据库中确定每张知识图谱的图谱得分,包括:
15、
16、其中,为预设知识图谱数据库中第n个知识图谱的图谱得分,和预设权重,k为关键词集中关键词的总数量,u为检索查询语句的总数量,为关键词集中的第i个关键词在第j个检索查询语句中出现的数量,为第i个关键词在第n个知识图谱中的数量,为含核心关键词的检索查询语句的数量。
17、进一步地,将第二文本输入预设大语言模型中,得到目标用户的第一提问对应的目标答复,还包括:
18、根据目标知识图谱,对预设大语言模型进行微调,得到微调后的预设大语言模型;
19、将第二文本输入微调后的预设大语言模型,得到目标用户的第一提问对应的目标答复。
20、进一步地,确定第一关键词集与第二关键词集之间的关键词重复率,包括:
21、
22、其中,为第一关键词集与第二关键词集之间的关键词重复率,为第一关键词集与第二关键词集中相同的关键词的数量,为第二关键词集中关键词的数量,为第一关键词集中关键词的数量。
23、进一步地,根据目标知识图谱,对预设大语言模型进行微调,得到微调后的预设大语言模型,包括:
24、从目标知识图谱抽取若干训练数据集,训练数据集的类型共包括:关系实体数据集、命名实体数据集以及答复数据集;
25、基于若干训练数据集对预设大语言模型进行训练,得到预设大语言模型的若干模拟输出,每个模拟输出对应一个标准输出;
26、根据若干模拟输出和若干标准输出,确定输出验证指标;
27、当输出验证指标满足预设训练要求时,得到微调后的预设大语言模型。
28、进一步地,根据若干模拟输出和若干标准输出,确定输出验证指标,包括:
29、根据模拟输出以及该模拟输出对应的标准输出,确定该模拟输出对应的输出重复率;
30、根据若干模拟输出和若干标准输出,确定长度参数;
31、根据模拟输出以及该模拟输出对应的标准输出,确定该模拟输出对应的长度相似度;
32、根据若干模拟输出对应的输出重复率、长度参数以及若干模拟输出对应的长度相似度,确定输出验证指标。
33、进一步地,确定输出验证指标,包括:
34、
35、
36、其中,为输出验证指标,为长度参数,为第y个模拟输出对应的输出重复率,和均为预设权重,为第y个模拟输出对应的长度相似度,为在第y个模拟输出和第y个标准输出中的句子长度最大值,为在第y个模拟输出与第y个标准输出中的最长相同句子长度。
37、进一步地,根据若干模拟输出和若干标准输出,确定长度参数,包括:
38、,或,
39、
40、其中,为长度参数,为若干模拟输出的字数总数量,若干标准输出的字数总数量。
41、第二方面,本发明提供了一种融合大语言模型和知识图谱的智能答复装置,装置包括:
42、第一判断模块,用于获取目标用户的第一提问,并判断目标用户是否存在第二提问,第一提问为当前提问,第二提问为第一提问之前的上一提问;
43、第二判断模块,用于若不存在时,则基于预设大语言模型获取第一提问的答复;若存在,则判断第一提问与第二提问之间的时间间隔是否在第一预设时长内;
44、提取模块,用于若不在时,则基于预设大语言模型获取第一提问的答复;若在,则基于预设大语言模型分别提取第一提问的第一关键词集与第二提问的第二关键词集;
45、第三判断模块,用于判断第一关键词集与第二关键词集之间的关键词重复率是否大于重复率阈值;
46、筛选模块,用于若不大于时,则基于预设大语言模型获取第一提问的答复;若大于,则根据第一关键词集与第二关键词集构建若干检索查询语句,并从预设知识图谱数据库中筛选出目标知识图谱;
47、填充模块,用于基于若干检索查询语句在目标知识图谱中进行检索后,得到若干第一检索结果,并以若干第一检索结果对预设提示词结构框架进行填充,得到第一文本,预设提示词结构框架包括:背景介绍、辅助信息、答复格式以及核心问题;
48、第二文本模块,用于将第一提问填充至第一文本中,得到第二文本;
49、输出模块,用于将第二文本输入预设大语言模型中,得到目标用户的第一提问对应的目标答复
50、本发明实施例中提供的一个或多个技术方案,至少具有如下技术效果或优点:
51、本发明通过判断是否存在第二提问以及判断时间间隔是否在第一预设时长内,可实现提前准备相关信息或引导,使得交互过程更加流畅自然;通过识别问题的连续性,可以更好地理解用户的意图;通过连续递进性的判断,强调了第一提问与第二提问在时间与空间上的强关联性;并且本发明还通过合理设置第一预设时长,能够较人性化的强调时间上的关联性;通过“判断是否存在第二提问以及判断时间间隔”,可以极大提高后续命中第一问题的准确性。
52、本发明通过设置重复率阈值,用以确定第一提问和第二提问在内容关联性,用以为构建更准确、关联性更强的查询语句提供基础,能够实现对预设知识图谱数据库进行较准确的筛选,也就提高了答复的命中率。
53、本发明通过设置预设排名阈值,未限制知识图谱仅为一张,换而言之,可以获取出多个答复,通过丰富答案以提高命中率。
54、本发明通过将每个知识图谱中关键词的出现频率并结合检索查询语句中的关键词分布,可以量化每张知识图谱的相关程度;通过对所有检索查询语句中关键词的总数进行归一并对数化,有助于平滑得分,减少极端值的影响,使得分更加稳定和可靠,用以更准确地找到与用户查询最相关的知识图谱,从而提高查询效率和用户体验。
55、本发明通过设置预设提示词结构框架,可以帮助大语言模型更好理解第一提问,还生成了结构化且丰富的答复;不仅直接回答了用户的核心问题,还提供了更多的背景和辅助信息,提升了用户体验。
56、本发明通过字数、句子长度、句子相似度等指标对验证指标进行设计,可以较好的对预设大语言模型的训练效果进行验证,提高了预设大语言模型回答的命中率。
1.一种融合大语言模型和知识图谱的智能答复方法,其特征在于,所述方法包括:
2.如权利要求1所述的一种融合大语言模型和知识图谱的智能答复方法,其特征在于,从预设知识图谱数据库中筛选出目标知识图谱,包括:
3.如权利要求2所述的一种融合大语言模型和知识图谱的智能答复方法,其特征在于,确定所述预设知识图谱数据库中确定每张知识图谱的图谱得分,包括:
4.如权利要求1所述的一种融合大语言模型和知识图谱的智能答复方法,其特征在于,将所述第二文本输入所述预设大语言模型中,得到所述目标用户的第一提问对应的目标答复,还包括:
5.如权利要求1所述的一种融合大语言模型和知识图谱的智能答复方法,其特征在于,确定第一关键词集与所述第二关键词集之间的关键词重复率,包括:
6.如权利要求4所述的一种融合大语言模型和知识图谱的智能答复方法,其特征在于,根据所述目标知识图谱,对所述预设大语言模型进行微调,得到微调后的预设大语言模型,包括:
7.如权利要求6所述的一种融合大语言模型和知识图谱的智能答复方法,其特征在于,所述根据若干模拟输出和若干标准输出,确定输出验证指标,包括:
8.如权利要求7所述的一种融合大语言模型和知识图谱的智能答复方法,其特征在于,确定所述输出验证指标,包括:
9.如权利要求7所述的一种融合大语言模型和知识图谱的智能答复方法,其特征在于,根据若干模拟输出和若干标准输出,确定长度参数,包括:
10.一种融合大语言模型和知识图谱的智能答复装置,其特征在于,所述装置包括:
