一种基于检索增强的大语言模型策略生成方法及系统与流程

专利2026-07-26  5


本发明涉及人工智能,尤其涉及一种基于检索增强的大语言模型策略生成方法及系统。


背景技术:

1、大模型在自然语言处理、图像识别等领域取得了显著的进展。然而,在具身智能应用场景中,如室内机器人移动、机械臂操作等任务,传统的大语言模型往往存在泛化能力不足和无法为具体场景生成专用策略的问题。这些任务通常需要模型具备场景定制的决策能力,并能在复杂的环境中进行自主学习和适应。

2、常见的策略生成框架大致可以分为两类,一类是通过强化学习方式为特定场景学习特定策略技术框架,另一类是基于通用大语言模型直接策略推理的技术框架。

3、强化学习(reinforcement learning,rl)技术框架虽然在许多具身智能应用场景中表现出色,但也存在一些问题。首先,强化学习算法需要大量的训练数据和时间才能找到最优策略,这在实际应用中可能会导致效率低下和成本高昂等问题。其次,强化学习方法在训练过程中往往需要反复试验,这可能会导致智能体在实际操作中遭受损坏或导致危险。此外,模型的训练通常依赖于精确的环境建模,如果环境发生变化,模型可能需要重新训练,从而降低了系统的灵活性和适应性。

4、基于大语言模型(large language model,llm)直接策略推理的技术框架虽然能够利用预训练模型生成策略,减少针对特定场景的大量训练,但也存在一些挑战。首先,大语言模型生成的策略可能缺乏针对具体场景的精确度和可行性,导致执行过程中出现错误或不理想的结果。其次,大语言模型生成策略时也无法根据场景的特异性做出定制化的判断和决策。此外,大语言模型的策略生成依赖于输入的自然语言描述,如果输入描述不够清晰或准确,生成的策略也可能不准确,影响实际效果。


技术实现思路

1、基于背景技术存在的技术问题,本发明提出了一种基于检索增强的大语言模型策略生成方法及系统,建立场景交互轨迹的检索数据库,得到具有定制化决策能力的决策策略。

2、本发明提出的一种基于检索增强的大语言模型策略生成方法,包括如下步骤:

3、步骤一、将多个任务组成一组,在初始轮次中,分别获取多个任务下智能体与环境交互得到的轨迹数据,从轨迹数据中分离出不同的结构数据系列,所述结构数据系列包括观测序列和宏动作序列,将每个任务的观测序列组织成一个图模型,对每个图模型进行编码得到固定长度的特征向量并与宏动作序列一起储存到数据库中;

4、步骤二、将第i个任务作为当前任务,在当前轮次中,获取当前任务下环境给予的观测图片,所述观测图片包括观测特征和动作特征,将观测特征转化为标签文本并编码为查询特征向量,将查询特征向量和数据库中所有的特征向量进行余弦相似度匹配并降序排列,从数据库中取排在前k个相似度对应的特征向量,并将所取出的特征向量输入到大语言模型的prompt中,输出所取出特征向量对应的图模型并编码,i∈[1,n],n为一组中任务的总数量;

5、步骤三、将所取出的特征向量对应的宏动作序列从数据库中取出,大语言模型以设定提示词以及所选出的宏动作序列作为索引从设定的宏动作库中选择其中一个宏动作,将每个宏动作按照事先设定原则转换成执行的微动作并依次输入给环境以进行交互,将交互后的宏动作与步骤二中对应编码后的图模型作为临时特征序列暂存;

6、步骤四,令i=i+1,重复步骤二至步骤三,得到所有任务对应的临时特征序列,基于所有临时特征序列对数据库进行更新;

7、步骤五、将更新后的数据库作为下一组多任务下智能体与环境交互的数据库,迭代步骤二至步骤四,直至数据库最终迭代更新完成。

8、进一步地,在步骤一中,对每个图模型进行编码得到固定长度的特征向量,具体包括:

9、在图模型中基础物体作为根节点,其他物体作为叶节点;

10、将根节点和叶节点转化为字符串类型,并通过句特征提取模块将字符串类型输出为固定长度的特征向量。

11、进一步地,在步骤二中,将观测特征转化为标签文本并编码为查询特征向量,具体为:

12、通过使用maskrcnn或textworld工具将观测特征转换成标签文本;

13、将标签文本转化为图模型,在图模型中基础物体作为根节点,其他物体作为叶节点;

14、将根节点和叶节点转化为字符串类型,并通过句特征提取模块将字符串类型输出为查询特征向量。

15、进一步地,在步骤三中,每个宏动作遵从“动作不涉及具体参数只关注物体”的原则。

16、一种基于检索增强的大语言模型策略生成系统,包括初始构建模块、观测匹配模块、动作匹配模块、当前组下数据库更新模块和下一组下数据库更新模块;

17、初始构建模块用于将多个任务组成一组,在初始轮次中,分别获取多个任务下智能体与环境交互得到的轨迹数据,从轨迹数据中分离出不同的结构数据系列,所述结构数据系列包括观测序列和宏动作序列,将每个任务的观测序列组成一个图模型,对每个图模型进行编码得到固定长度的特征向量并与宏动作序列一起储存到数据库中;

18、观测匹配模块用于将第i个任务作为当前任务,在当前轮次中,获取当前任务下环境给予的观测图片,所述观测图片包括观测特征和动作特征,将观测特征转化为标签文本并编码为查询特征向量,将查询特征向量和数据库中所有的特征向量进行余弦相似度匹配并降序排列,从数据库中取排在前k个相似度对应的特征向量,并将所取出的特征向量输入到大语言模型的prompt中,输出所取出特征向量对应的图模型并编码,i∈[1,n],n为一组中任务的总数量;

19、动作匹配模块用于将所取出的特征向量对应的宏动作序列从数据库中取出,大语言模型以设定提示词以及所选出的宏动作序列作为索引从设定的宏动作库中选择其中一个宏动作,将所选宏动作按照事先设定原则转换成执行的微动作并依次输入给环境以进行交互,将交互后的宏动作与步骤二中对应编码后的图模型作为临时特征序列暂存;

20、当前组下数据库更新模块用于令i=i+1,重复观测匹配模块至动作匹配模块,得到所有任务对应的临时特征序列,基于所有临时特征序列对数据库进行更新;

21、下一组下数据库更新模块用于将更新后的数据库作为下一组多任务下智能体与环境交互的数据库,迭代观测匹配模块至当前组下数据库更新模块,直至数据库最终迭代更新完成。

22、进一步地,在初始构建模块中,对每个图模型进行编码得到固定长度的特征向量,具体包括:

23、在图模型中基础物体作为根节点,其他物体作为叶节点;

24、将根节点和叶节点转化为字符串类型,并通过句特征提取模块将字符串类型输出为固定长度的特征向量。

25、一种计算机设备,包括存储器、处理器及存储在所述存储器上并可在所述处理器上运行的计算机程序,所述处理器执行所述计算机程序时实现如上所述的大语言模型策略生成方法。

26、一种计算机可读储存介质,所述计算机可读储存介质上存储有若干分类程序,所述若干分类程序用于被处理器调用并执行如上所述的大语言模型策略生成方法。

27、本领域普通技术人员可以理解:实现上述方法实施例的全部或部分步骤可以通过程序指令相关的硬件来完成,前述的程序可以存储于一计算机可读取存储介质中,该程序在执行时,执行包括上述方法实施例的步骤;而前述的存储介质包括:rom、ram、磁碟或者光盘等各种可以存储程序代码的介质。

28、本发明提供的一种基于检索增强的大语言模型策略生成方法及系统的优点在于:结合了渐进式检索增强的生成框架和基于大语言模型(llm)直接策略推理技术框架的优点,以解决传统方法在具身智能应用场景中的局限性。通过结合渐进式检索增强框架和大语言模型,本实施例具有以下有益效果:首先,利用大语言模型生成初步策略,再通过渐进式检索增强生成框架进行细化和优化,提升了大语言模型在复杂环境中的泛化能力和适应性。大语言模型提供的初步策略基础能够减少训练数据和时间的需求,而渐进式检索增强生成框架则能根据具体场景进行定制化调整。其次,大语言模型提供了预训练策略,减少了算法在初期探索阶段所需的大量训练数据和时间,从而降低了训练成本和效率问题。

29、通过将大语言模型生成的策略与渐进式检索增强框架的精确调整相结合,本实施例能够生成更为精确和可行的策略,减少执行过程中出现的错误和不理想结果。此外,本实施例的数据库更新是当前组更新后的数据库作为下一组多任务下机器人与环境交互的数据库,因而能够在环境发生变化时,通过在检索增强的数据库中的检索迅速调整策略,无需完全重新训练,增强了系统的灵活性和自主学习能力。


技术特征:

1.一种基于检索增强的大语言模型策略生成方法,其特征在于,包括如下步骤:

2.根据权利要求1所述的基于检索增强的大语言模型策略生成方法,其特征在于,在步骤一中,对每个图模型进行编码得到固定长度的特征向量,具体包括:

3.根据权利要求1所述的基于检索增强的大语言模型策略生成方法,其特征在于,在步骤二中,将观测特征转化为标签文本并编码为查询特征向量,具体为:

4.根据权利要求1所述的基于检索增强的大语言模型策略生成方法,其特征在于,在步骤三中,每个宏动作遵从“动作不涉及具体参数只关注物体”的原则。

5.一种基于检索增强的大语言模型策略生成系统,其特征在于,包括初始构建模块、观测匹配模块、动作匹配模块、当前组下数据库更新模块和下一组下数据库更新模块;

6.根据权利要求5所述的基于检索增强的大语言模型策略生成方法,其特征在于,在初始构建模块中,对每个图模型进行编码得到固定长度的特征向量,具体包括:

7.一种计算机设备,包括存储器、处理器及存储在所述存储器上并可在所述处理器上运行的计算机程序,其特征在于,所述处理器执行所述计算机程序时实现如权利要求1-4任一所述的大语言模型策略生成方法。

8.一种计算机可读储存介质,其特征在于,所述计算机可读储存介质上存储有若干分类程序,所述若干分类程序用于被处理器调用并执行如权利要求1-4任一所述的大语言模型策略生成方法。


技术总结
本发明公开了一种基于检索增强的大语言模型策略生成方法及系统,包括如下步骤:步骤一、将多个任务组成一组,在初始轮次中,构建数据库;步骤二、将第i个任务作为当前任务,基于观测图片中的观测特征通过大语言模型得到图模型并编码,步骤三、从数据库中取出对应的宏动作序列,得到与环境交互后的宏动作,并与步骤二中对应编码后的图模型作为临时特征序列暂存;步骤四,令i=i+1,重复步骤二至步骤三,得到所有任务对应的临时特征序列,基于所有临时特征序列对数据库进行更新;该大语言模型策略生成方法建立场景交互轨迹的检索数据库,得到具有定制化决策能力的决策策略。

技术研发人员:王敏,徐炜烨,周文罡,李厚强
受保护的技术使用者:合肥综合性国家科学中心人工智能研究院(安徽省人工智能实验室)
技术研发日:
技术公布日:2024/12/17
转载请注明原文地址:https://xbbs.6miu.com/read-32975.html