本发明涉及固定翼无人机控制领域,具体涉及一种基于深度强化学习的固定翼无人机编队控制方法及装置。
背景技术:
1、固定翼无人机因其具有较高飞行速度和较长飞行距离的特点受到高度关注。面对日益复杂的环境,单个无人机已难以满足任务需求,因此需要多无人机协同,故本发明聚焦于固定翼无人机的协同编队控制。
2、传统的编队控制方法,如pid控制和lqr控制,难以应对固定翼无人机在复杂环境中的动态变化。
技术实现思路
1、本发明的目的在于提供一种基于深度强化学习的固定翼无人机编队控制方法,解决现有技术中固定翼无人机在连续空间的复杂条件下编队控制困难的问题,提高编队的稳定性和效率。
2、为了实现上述目的,本发明采用的技术方案是:
3、一种基于深度强化学习的固定翼无人机编队控制方法,包括以下步骤:
4、s1:建立固定翼无人机运动学模型,构建无人机仿真训练环境,对于输入给模型的控制指令,通过底层pid控制器完成闭环控制;
5、s2:通过深度神经网络构建actor网络和critic网络;
6、s3:跟随无人机和领航无人机分别收集各自的状态信息,包括位置、速度、航迹角、航向角和剩余燃料比信息,形成联合状态空间;跟随无人机依据其控制指令输出倾侧角构建动作空间;
7、s4:根据无人机的特点以及编队任务设计强化学习的奖励函数,以引导无人机获得最大奖励;
8、s5:在无人机与环境交互的过程中,利用历史数据不断更新actor网络和critic网络的参数,从而训练形成最终的actor网络模型;所述历史数据包括当前状态、所执行的动作、动作产生的奖励以及执行动作后达到的下一状态;
9、s6:在执行飞行任务时,跟随无人机实时收集自身和领航无人机的当前状态信息,并组合成联合状态,将所述联合状态输入到所述最终的actor网络模型,生成跟随无人机的倾侧角控制指令。
10、本发明根据固定翼无人机的特点以及编队任务,设计了一套符合固定翼无人机编队的强化学习奖励函数。该函数包括五个部分:速度矢量对准奖励函数:驱动编队成员速度矢量快速对准期望几何构型点;距离奖励函数:驱动编队成员快速向期望位置靠拢,当编队成员距离期望空间位置更近,则给无人机施加正向奖励,反之,施加负奖励;航向角奖励函数:为进一步减小队形形成时间,对跟随无人机速度矢量方向角进行约束,使得跟随无人机速度矢量与领航无人机速度矢量保持一致,进而形成稳定编队;过程奖励函数:用于对无人机过程状态变量进行约束;能量消耗奖励函数:能量消耗奖励函数用于对编队形成过程中的能量消耗进行优化。
11、本发明考虑实际情况中固定翼无人机在执行任务时携带的燃料是有限的,故本发明在构建无人机强化学习算法时将剩余燃料比作为状态输入的一部分,同时在奖励函数中也针对剩余燃料的状态设计了奖惩机制,以此对算法进行训练,可以让无人机在编队过程中达到既能节省燃料的同时又能输出最佳控制指令的效果。
12、本发明同时提供了一种基于深度强化学习的固定翼无人机编队控制装置,包括:
13、学习训练模块:建立固定翼无人机的运动学模型,通过深度神经网络构建actor网络和critic网络,并在跟随无人机与环境交互的过程中,利用历史数据不断更新actor网络和critic网络的参数,从而训练形成最终的actor网络模型;这些历史数据包括当前状态、所执行的动作、动作产生的奖励,以及执行动作后达到的下一状态;在交互过程中,跟随无人机收集自身和领航无人机的当前状态信息,形成联合状态;actor网络根据该联合状态输出跟随无人机的控制指令,并通过固定翼无人机的运动学模型计算各无人机在下一时刻的状态;
14、任务执行模块:在执行飞行任务时,跟随无人机实时收集自身和领航无人机的当前状态信息,并组合成联合状态,输入到经过训练的actor网络模型中,由该actor网络模型基于实时获取的联合状态生成各跟随无人机的控制指令,调整其倾侧角。
15、本发明通过在固定翼无人机编队任务中,由各跟随无人机知道自己以及领航无人机的状态信息,跟随无人机再根据自身actor网络输出的控制指令,实现编队的形成和保持。该方法在连续状态和动作空间解决了leader-follower拓扑下的固定翼无人机编队问题,提高了无人机执行任务的智能性和灵活性。
16、本发明通过集成多机编队协同任务的感知和控制、无人机模型与环境扰动的结合、actor与critic网络的构建以及完善的回报函数设计,构建了一种基于深度强化学习的高效、安全和灵活的固定翼无人机编队控制方法。其特点和优势在于无需依赖精确模型即可实现高效的编队控制,能够适应不同规模的编队任务,并显著提高了控制策略的可迁移性。
1.一种基于深度强化学习的固定翼无人机编队控制方法,其特征在于,包括以下步骤:
2.根据权利要求1所述的基于深度强化学习的固定翼无人机编队控制方法,其特征在于,s1中所述固定翼无人机运动学模型如下:
3.根据权利要求1所述的基于深度强化学习的固定翼无人机编队控制方法,其特征在于,所述pid控制器由比例、积分和微分三个部分组成,其控制输出c(t)代表无人机真实值,计算公式如下:
4.根据权利要求1所述的基于深度强化学习的固定翼无人机编队控制方法,其特征在于,s2中所述actor网络和critic网络的构建过程如下:
5.根据权利要求1所述的基于深度强化学习的固定翼无人机编队控制方法,其特征在于,s3中飞所述行器构建联合状态空间和动作空间的具体方法为:
6.根据权利要求1所述的基于深度强化学习的固定翼无人机编队控制方法,其特征在于,s4中所述奖励函数的形式如下:
7.根据权利要求1所述的基于深度强化学习的固定翼无人机编队控制方法,其特征在于,s5中所述无人机从历史数据中不断更新actor网络和critic网络的方法为:
8.根据权利要求7所述的基于深度强化学习的固定翼无人机编队控制方法,其特征在于,为所述控制器输出动作加上干扰,干扰服从零均值正态分布,为σγ为标准差。
9.根据权利要求1所述的基于深度强化学习的固定翼无人机编队控制方法,其特征在于,s6中所述无人机在任务执行时的具体方法为:
10.一种基于深度强化学习的固定翼无人机编队控制装置,其特征在于,包括:
