语言模型的优化、处理方法、设备、介质和程序产品与流程

专利2026-09-15  7


本技术涉及计算机,特别是涉及一种语言模型的优化方法、一种基于语言模型的处理方法、一种电子设备、一种计算机可读存储介质和一种计算机程序产品。


背景技术:

1、传统的大型语言模型 (large language models,llm) 在语言理解、生成、交互和推理等各个领域都表现出了令人印象深刻的能力。尽管这些模型具有这些显著的优势,但它们仍然面临着重大挑战,例如无法获取实时信息以及难以完成精确的数学任务。工具增强型llm的开发通过促进与外部工具的有效交互,极大地提高了 llm的性能。这一进步使它们能够充当用户和大型应用程序生态系统之间的有效中介。工具增强型llm已被广泛应用于各种应用—包括网页浏览、多模态推理等,并取得了出色的成果。

2、目前,开源llm与工具使用的下游任务相结合的大部分工作都依赖于使用专家轨迹数据集的监督微调,这种方法训练llm根据观察和先前的操作学习后续操作的策略。在这一研究领域,早期研究通常存在一些局限性,例如工具种类有限、依赖单一工具场景以及使用基本推理方法。最近,有研究提出了指令调优数据集,其中包含16,000多个真实世界api和各种现实指令,以及基于深度优先搜索决策树创建的专家注释。此外,他们还使用该数据集执行有监督微调。然而,该模型仍然严重依赖于使用专家轨迹进行微调,这可能导致对环境的探索不足和次优策略。此外,在深度优先搜索决策中,有监督微调仅使用成功的答案,忽略了失败尝试中的宝贵信息,导致数据利用率低。


技术实现思路

1、本技术实施例提供了一种语言模型的优化方法,以提高数据利用率。

2、相应的,本技术实施例还提供了一种基于语言模型的处理方法,一种电子设备,一种计算机可读存储介质和一种计算机程序产品,用以保证上述系统的实现及应用。

3、为了解决上述问题,本技术实施例公开了一种语言模型的优化方法,其中,所述方法包括:

4、获取语言模型对应调用工具的路径数据,基于所述路径数据构建偏好数据集,所述路径数据包括成功路径和失败路径;

5、基于所述偏好数据集获取输入数据,将所述输入数据输入到所述语言模型中,获取对应的输出结果;

6、基于所述输出结果和奖励模型确定损失函数;

7、基于所述损失函数调整所述语言模型的参数,得到优化的语言模型。

8、可选的,所述获取语言模型对应调用工具的路径数据,包括:

9、通过决策树确定语言模型调用工具的路径,获取对应的成功路径和失败路径;

10、基于所述成功路径和失败路径构建路径偏好对;

11、基于所述路径偏好对构建偏好数据集。

12、可选的,所述获取语言模型对应调用工具的路径数据,包括:

13、通过决策树确定语言模型调用工具的成功路径;

14、基于所述成功路径和决策树构建对应的失败路径,构造的失败路径至少尾节点与对应成功路径的尾节点不同;

15、将所述成功路径和对应的失败路径作为路径偏好对;

16、基于所述路径偏好对构建偏好数据集。

17、可选的,所述基于所述成功路径和决策树构建对应的失败路径,包括:

18、在所述决策树中对所述成功路径从叶子节点开始向上遍历;

19、针对具有分支的节点,将分支的另一个节点和所述分支的节点之上的路径构成失败路径,得到至少一个失败路径。

20、可选的,所述基于所述偏好数据集获取输入数据,包括:

21、基于所述偏好数据集,确定路径偏好对对应的指令词;

22、基于所述指令词构建对应的输入数据。

23、可选的,还包括构建所述奖励模型的步骤:

24、基于比较模型构建偏好的奖励模型,基于设定算法估计所述奖励模型的参数。

25、可选的,还包括:

26、确定偏好优化算法,基于所述偏好优化算法对所述奖励模型进行优化,其中,所述偏好优化算法的优化目标是奖励最大化。

27、可选的,还包括:

28、确定强化学习算法,基于所述强化学习算法对所述奖励模型进行优化,其中,所述强化学习算法的优化目标是奖励最大化。

29、可选的,还包括:

30、基于所述成功路径作为训练数据,对所述语言模型进行微调。

31、本技术实施例还公开了一种基于语言模型的处理方法,其中,所述方法包括:

32、接收通过客服页面获取的服务需求信息;

33、通过语言模型对所述服务需求信息进行分析,确定所需的服务工具的工具路径,其中,所述语言模型训练过程中的损失函数基于奖励模型确定,所述语言模型的训练数据基于偏好数据集确定,所述偏好数据集基于所述语言模型对应调用工具的路径数据确定,所述路径数据包括成功路径和失败路径;

34、基于所述工具路径获取对应的服务信息;

35、基于所述服务信息生成服务需求结果;

36、发送所述服务需求结果,以通过所述客服页面反馈所述服务需求结果。

37、可选的,所述服务工具包括以下至少一种工具:物流查询工具、订单查询工具、商品查询工具。

38、本技术实施例还公开了一种基于语言模型的处理方法,其中,所述方法包括:

39、通过客服页面接收资源撤回信息;

40、通过语言模型对所述资源撤回信息进行分析,确定资源撤回对应关联信息的服务工具的工具路径,其中,所述语言模型训练过程中的损失函数基于奖励模型确定,所述语言模型的训练数据基于偏好数据集确定,所述偏好数据集基于所述语言模型对应调用工具的路径数据确定,所述路径数据包括成功路径和失败路径;

41、基于所述工具路径获取对应的关联信息;

42、基于所述关联信息确定资源撤回结果;

43、发送所述资源撤回结果,以通过所述客服页面反馈所述资源撤回结果。

44、可选的,所述服务工具包括以下至少一种工具:物流查询工具、订单查询工具、商品查询工具、服务信息查询工具、信用查询工具。

45、本技术实施例还公开了一种电子设备,其中,包括:处理器,以及与所述处理器通信连接的存储器;

46、所述存储器存储计算机执行指令;

47、所述处理器执行所述存储器存储的计算机执行指令,以实现如本技术实施例所述的方法。

48、本技术实施例还公开了一种计算机可读存储介质,其中,所述计算机可读存储介质中存储有计算机执行指令,所述计算机执行指令被处理器执行时用于实现如本技术实施例所述的方法。

49、本技术实施例还公开了一种计算机程序产品,包括计算机程序/计算机可执行指令,其中,所述计算机程序/计算机可执行指令被电子设备中的处理器执行时实现本技术实施例所述方法。

50、与现有技术相比,本技术实施例包括以下优点:

51、本技术实施例中,获取语言模型对应调用工具的路径数据,基于所述路径数据构建偏好数据集,所述路径数据包括成功路径和失败路径,从而能够通过引入失败决策信息,丰富偏好数据集,提高了数据利用率,再基于所述偏好数据集获取输入数据,将所述输入数据输入到所述语言模型中,获取对应的输出结果,基于所述输出结果和奖励模型确定损失函数,基于所述损失函数调整所述语言模型的参数,得到优化的语言模型,提高语言模型的准确性。


技术特征:

1.一种语言模型的优化方法,其中,所述方法包括:

2.根据权利要求1所述的方法,其中,所述获取语言模型对应调用工具的路径数据,包括:

3.根据权利要求1所述的方法,其中,所述获取语言模型对应调用工具的路径数据,包括:

4.根据权利要求3所述的方法,其中,所述基于所述成功路径和决策树构建对应的失败路径,包括:

5.根据权利要求2或3所述的方法,其中,所述基于所述偏好数据集获取输入数据,包括:

6.根据权利要求5所述的方法,其中,还包括构建所述奖励模型的步骤:

7.根据权利要求6所述的方法,其中,还包括基于奖励模型确定损失函数的步骤:

8.根据权利要求6所述的方法,其中,还包括基于奖励模型确定损失函数的步骤:

9.根据权利要求1所述的方法,其中,还包括:

10.一种基于语言模型的处理方法,其中,所述方法包括:

11.根据权利要求10所述的方法,其中,所述服务工具包括以下至少一种工具:物流查询工具、订单查询工具、商品查询工具。

12.一种基于语言模型的处理方法,其中,所述方法包括:

13.根据权利要求12所述的方法,其中,所述服务工具包括以下至少一种工具:物流查询工具、订单查询工具、商品查询工具、服务信息查询工具、信用查询工具。

14.一种电子设备,其中,包括:处理器,以及与所述处理器通信连接的存储器;

15.一种计算机可读存储介质,其中,所述计算机可读存储介质中存储有计算机执行指令,所述计算机执行指令被处理器执行时用于实现如权利要求1-13中任一项所述的方法。

16.一种计算机程序产品,包括计算机程序/计算机可执行指令,其中,所述计算机程序/计算机可执行指令被电子设备中的处理器执行时实现权利要求 1-13任一项所述方法。


技术总结
本申请实施例提供了一种语言模型的优化、处理方法、设备、介质和程序产品。所述方法包括:获取语言模型对应调用工具的路径数据,基于所述路径数据构建偏好数据集,所述路径数据包括成功路径和失败路径;基于所述偏好数据集获取输入数据,将所述输入数据输入到所述语言模型中,获取对应的输出结果;基于所述输出结果和奖励模型确定损失函数;基于所述损失函数调整所述语言模型的参数,得到优化的语言模型。能够通过引入失败决策信息,丰富偏好数据集,提高了数据利用率,据此优化语言模型,提高语言模型的准确性。

技术研发人员:吴逸峰,陈庆国,陈思佳
受保护的技术使用者:杭州阿里巴巴海外互联网产业有限公司
技术研发日:
技术公布日:2024/12/17
转载请注明原文地址:https://xbbs.6miu.com/read-34438.html