基于偏好学习的人员操作风格量化辨识方法

专利2026-07-03  9


本技术的实施例涉及人机交互,特别涉及一种基于偏好学习的人员操作风格量化辨识方法。


背景技术:

1、目前,许多机器人系统仍然需要操作员进行操作,如空间遥操作、人类技能示教、驾驶任务等。空间遥操作可被分为轨道上的机械臂操作和其他星体表面的移动机器人操作,对于星体表面的移动机器人操作而言,由于其环境复杂,未见场景多,往往需要人类遥操作,这和地面驾驶任务的情形是比较相似的。对于这类任务而言,人类操作的特性通常会影响对这类机器人系统的设计,例如在驾驶任务中,自动驾驶系统将能够如同人类驾驶员一样根据当前车辆所处场景,生成合适的车辆控制。出于安全性原因,一套自动驾驶系统生成的行为通常是确定性的,比如以特定的速度进行巡航等。然而,人类的操作风格通常是个性化、多样化的,不同的驾驶员在同一场景下的习惯有所不同,如果自动驾驶行为与人类习惯不同,就会增大驾驶员对自动驾驶系统的不信任,这给如何开发一个人员友好的自动驾驶系统带来了非常大的困难。车辆不仅要保证驾驶的行为安全,还要与当前驾驶员的操作风格对齐,以增加驾驶员对自动驾驶系统的信任。因此,在人机交互的角度上,研究人类的操作特性逐渐成为了一个被关注的问题。

2、基于学习的方法为这类问题提供了一条通用途径,技术人员可以通过一些标注有风格标签的人机交互数据,训练出一个人员操作风格分类网络。例如,对于一些筛选出的驾驶轨迹而言,人类可以较简单地判断出驾驶轨迹是激进的、中立的、或是保守的,进而根据这种数据集训练一个分类器网络。然而,这种分类方法是粗糙的,他只能将人类的行为分为有限的类,而对于类内更细致的比较则因缺乏信息而显得十分不足,如果将类设定的较多,则又会导致各类训练数据的缺乏。因此,基于分类的方案不能实现人类操作风格的精准对齐。


技术实现思路

1、有鉴于此,本技术的实施例提出了一种基于偏好学习的人员操作风格量化辨识方法,采用偏好对比的方式,对驾驶轨迹进行两两判别,确定哪一条驾驶轨迹更激进,进而形成连续的值网络,实现对人类风格的精准对齐。

2、为实现上述目的,本技术的实施例提出了一种基于偏好学习的人员操作风格量化辨识方法,包括:录制不同的驾驶员在驾驶时产生的行为数据,生成训练数据集;构建含有驾驶任务上下文的提示词,利用gpt-4大模型,对训练数据集中的训练数据采用偏好排序的方式进行标签标注,确定每一个训练数据的偏好标签;将训练数据集中的训练数据输入至预构建的操作风格量化辨识模型中,获得操作风格量化辨识模型的输出;其中,操作风格量化辨识模型由多模态的多头编码器、transformer编码器和transformer解码器组成;基于操作风格量化辨识模型对一个batch中的各训练数据的输出,以及所述batch中的各训练数据的偏好标签,构建损失函数,基于构建的损失函数对操作风格量化辨识模型进行迭代训练至收敛,得到训练完成的操作风格量化辨识模型;将待辨识行为数据输入至训练完成的操作风格量化辨识模型中,获得训练完成的操作风格量化辨识模型输出的待辨识行为数据对应的风格激进度。

3、为实现上述目的,本技术的实施例还提出了一种基于偏好学习的人员操作风格量化辨识系统,包括:数据采集模块,用于录制不同的驾驶员在驾驶时产生的行为数据,生成训练数据集;数据标注模块,用于构建含有驾驶任务上下文的提示词,利用gpt-4大模型,对训练数据集中的训练数据采用偏好排序的方式进行标签标注,确定每一个训练数据的偏好标签;模型构建模块,用于构建操作风格量化辨识模型,操作风格量化辨识模型由多模态的多头编码器、transformer编码器和transformer解码器组成;模型训练模块,用于将训练数据集中的训练数据输入至操作风格量化辨识模型中,获得操作风格量化辨识模型的输出,基于操作风格量化辨识模型对一个batch中的各训练数据的输出,以及所述batch中的各训练数据的偏好标签,构建损失函数,基于构建的损失函数对操作风格量化辨识模型进行迭代训练至收敛,得到训练完成的操作风格量化辨识模型;模型使用模块,用于将待辨识行为数据输入至训练完成的操作风格量化辨识模型中,获得训练完成的操作风格量化辨识模型输出的待辨识行为数据对应的风格激进度。

4、为实现上述目的,本技术的实施例还提出了一种电子设备,包括:至少一个处理器;以及,与所述至少一个处理器通信连接的存储器;其中,所述存储器存储有可被所述至少一个处理器执行的指令,所述指令被所述至少一个处理器执行,以使所述至少一个处理器能够执行上述所述的基于偏好学习的人员操作风格量化辨识方法。

5、为实现上述目的,本技术的实施例还提供了一种计算机可读存储介质,存储有计算机程序,所述计算机程序被处理器执行时,能够实现上述所述的基于偏好学习的人员操作风格量化辨识方法。

6、本技术的实施例提出的基于偏好学习的人员操作风格量化辨识方法,选用驾驶任务作为人机交互中人类操作任务的代表,研究驾驶任务中的风格量化辨识问题。录制不同的驾驶员在驾驶时产生的行为数据,生成训练数据集,再用gpt-4大模型,对训练数据集中的训练数据采用偏好排序的方式进行偏好标签标注,这样的标注方式大幅降低了标注难度和成本,并且提升了标注效率和标注精度。接下来构建并训练了由多模态的多头编码器、transformer编码器和transformer解码器组成的操作风格量化辨识模型,操作风格量化辨识模型具有良好的特征提取能力,能够充分辨识细粒度的操作风格,取得连续数值型的风格度量。在训练操作风格量化辨识模型时采用了bradley-terry偏好模型的思想来进行风格对齐,这样训练出的风格量化辨识模型无论操作员当前的操作情况如何,总能辨识出一个相应的风格值与操作员的操作行为对齐。

7、可选地,录制不同的驾驶员在驾驶时产生的行为数据时,使用metadrive仿真器作为录制平台,录制的每一条行为数据均由道路地图数据、自车的当前姿态数据、自车的历史姿态数据、自车的全局导航数据、自车的雷达传感器数据和他车的历史姿态数据构成;其中,道路地图数据为metadrive仿真器生成的包含道路信息、自车位置、他车位置的鸟瞰图,使用图像的格式进行保存,自车的当前姿态数据、自车的历史姿态数据、自车的全局导航数据、自车的雷达传感器数据和他车的历史姿态数据均使用向量的格式进行保存。

8、可选地,构建含有驾驶任务上下文的提示词,利用gpt-4大模型,对训练数据集中的训练数据采用偏好排序的方式进行标签标注,确定每一个训练数据的偏好标签,包括:构建含有驾驶任务上下文的提示词提供给gpt-4大模型,并为gpt-4大模型设置分析参考依据;其中,设置的分析参考依据包括自车与本车道上前车的距离、自车的速度、自车的加速度、自车在与他车进行交互时的行为、超车情况;随机选取两条训练数据输入至gpt-4大模型中,gpt-4大模型对输入的两条训练数据采用偏好排序的方式进行标签标注,gpt-4大模型为自身认为的操作风格更激进的训练数据标注激进标签,为自身认为的操作风格更保守的训练数据标注保守标签。

9、可选地,操作风格量化辨识模型的多模态的多头编码器由地图编码器、姿态编码器、导航编码器、雷达编码器、自车历史编码器和他车编码器构成;其中,地图编码器具体为一个预训练的resnet-18网络,姿态编码器、导航编码器、雷达编码器、自车历史编码器和他车编码器构成均为小型全连接网络。

10、可选地,地图编码器、姿态编码器、导航编码器、雷达编码器、自车历史编码器和他车编码器分别用于对训练数据中的道路地图数据、自车的当前姿态数据、自车的全局导航数据、自车的雷达传感器数据、自车的历史姿态数据和他车的历史姿态数据进行信息编码,并将编码得到的嵌入向量输入至transformer编码器中;transformer编码器用于基于输入的各嵌入向量进行特征提取,生成全局特征向量;transformer解码器用于对全局特征向量进行查询解码,得到操作风格量化辨识模型的输出,操作风格量化辨识模型的输出即训练数据对应的风格激进度。

11、可选地,基于操作风格量化辨识模型对一个batch中的各训练数据的输出,以及所述batch中的各训练数据的偏好标签,构建损失函数,包括:基于操作风格量化辨识模型对一个batch中的偏好标签为激进标签的训练数据的输出和偏好标签为保守标签的训练数据的输出,构建偏好学习损失项;基于操作风格量化辨识模型对所述batch中的各训练数据的输出中的绝对值的最大值和预设的正则化系数,构建正则化损失项;基于偏好学习损失项和正则化损失项,构建损失函数。

12、可选地,构建的损失函数通过以下公式表示:

13、ltotal=lpr(v)+γmax|v(xi,yi)|

14、

15、其中,lpr(v)表示偏好学习损失项,γmax|v(xi,yi)|表示正则化损失项,ltotal表示构建的损失函数,表示期望函数,y+表示激进标签,x+表示标注激进标签的训练数据,y-表示保守标签,x-表示标注保守标签的训练数据,v(x+,y+)表示操作风格量化辨识模型对偏好标签为激进标签的训练数据的输出,v(x-,y-)表示操作风格量化辨识模型对偏好标签为保守标签的训练数据的输出,σ(·)表示sigmoid函数,表示一个batch,v(xi,yi)表示操作风格量化辨识模型对所述batch中的第i个训练数据的输出,γ表示正则化系数。


技术特征:

1.一种基于偏好学习的人员操作风格量化辨识方法,其特征在于,包括:

2.根据权利要求1所述的基于偏好学习的人员操作风格量化辨识方法,其特征在于,录制不同的驾驶员在驾驶时产生的行为数据时,使用metadrive仿真器作为录制平台,录制的每一条行为数据均由道路地图数据、自车的当前姿态数据、自车的历史姿态数据、自车的全局导航数据、自车的雷达传感器数据和他车的历史姿态数据构成;

3.根据权利要求2所述的基于偏好学习的人员操作风格量化辨识方法,其特征在于,构建含有驾驶任务上下文的提示词,利用gpt-4大模型,对训练数据集中的训练数据采用偏好排序的方式进行标签标注,确定每一个训练数据的偏好标签,包括:

4.根据权利要求3所述的基于偏好学习的人员操作风格量化辨识方法,其特征在于,操作风格量化辨识模型的多模态的多头编码器由地图编码器、姿态编码器、导航编码器、雷达编码器、自车历史编码器和他车编码器构成;

5.根据权利要求4所述的基于偏好学习的人员操作风格量化辨识方法,其特征在于,地图编码器、姿态编码器、导航编码器、雷达编码器、自车历史编码器和他车编码器分别用于对训练数据中的道路地图数据、自车的当前姿态数据、自车的全局导航数据、自车的雷达传感器数据、自车的历史姿态数据和他车的历史姿态数据进行信息编码,并将编码得到的嵌入向量输入至transformer编码器中;

6.根据权利要求5所述的基于偏好学习的人员操作风格量化辨识方法,其特征在于,基于操作风格量化辨识模型对一个batch中的各训练数据的输出,以及所述batch中的各训练数据的偏好标签,构建损失函数,包括:

7.根据权利要求6所述的基于偏好学习的人员操作风格量化辨识方法,其特征在于,构建的损失函数通过以下公式表示:

8.一种基于偏好学习的人员操作风格量化辨识系统,其特征在于,包括:

9.一种电子设备,其特征在于,包括:

10.一种计算机可读存储介质,存储有计算机程序,其特征在于,所述计算机程序被处理器执行时,能够实现如权利要求1至7中任一项所述的基于偏好学习的人员操作风格量化辨识方法。


技术总结
本申请的实施例涉及人机交互技术领域,特别涉及一种基于偏好学习的人员操作风格量化辨识方法,包括:录制不同的驾驶员在驾驶时产生的行为数据,生成训练数据集;构建含有驾驶任务上下文的提示词,利用GPT‑4模型,对训练数据集中的训练数据采用偏好排序的方式进行标签标注,确定每个训练数据的偏好标签;将训练数据输入至预构建的操作风格量化辨识模型中,获得模型的输出;基于模型的输出和训练数据的偏好标签构建损失函数,基于构建的损失函数对模型进行迭代训练至收敛,得到训练完成的模型;将待辨识行为数据输入至训练完成的模型中,获得待辨识行为数据对应的风格激进度。该方法实现对人类风格的精准对齐。

技术研发人员:黄攀峰,刘子昊,刘星,张夷斋,白雪松
受保护的技术使用者:西北工业大学
技术研发日:
技术公布日:2024/12/17
转载请注明原文地址:https://xbbs.6miu.com/read-32177.html