本发明属于多智能体追逃博弈领域,具体涉及一种基于多智能体随机追逃博弈的概率可达集计算方法。
背景技术:
1、微分博弈理论已广泛应用于机器人技术、航天器、飞机控制等领域。在微分博弈中,追逃博弈定义在两个合作智能体的对抗团队之间,其中一个团队的目标是到达某一目标,而另一个团队的目标是阻止它们对手的成功。这个博弈是研究实现智能自动化系统所需的工具的一个极好的代理工具。
2、多人追逃博弈已经有了几个方面的探索。之前的许多研究更多地关注于博弈的多智能体协作方面,同时简化了对对抗方面的假设。在更复杂的追逃博弈中,智能体的角色可能会随着时间的推移而改变。对手的行动是基于预期的对手策略来预测的,反馈和重新规划用于调整在运行时与预测动作的偏差。在更一般的情况下,每一方都没有已知的先验信息,一个理想的框架是汉密尔顿-雅可比-艾萨克斯可达性方法,其中求解汉密尔顿-雅可比-艾萨克斯偏微分方程,以获得两个团队的最优策略。
3、大多数追逃博弈是在确定性环境下研究的,忽略了系统动力学和环境的不确定性影响。因此,有必要将当前的追逃博弈的解决方法扩展到一个更一般的框架中,其中系统动力学的随机部分应当被考虑。
技术实现思路
1、本发明所要解决的技术问题是:
2、为了避免现有技术的不足之处,本发明提供一种基于多智能体随机追逃博弈的概率可达集计算方法,用于解决系统动力学和环境的不确定性影响。从以下两个方面:
3、(1)建立随机追逃博弈问题与涉及不连续收益函数的随机最优控制问题之间的联系,并考虑博弈中多个智能体之间的互动。
4、(2)利用概率可达性分析来解决多智能体随机追逃博弈的问题。
5、为了解决上述技术问题,本发明采用的技术方案为:
6、一种基于多智能体随机追逃博弈的概率可达集计算方法,其特征在于,所述多智能体分为攻击者和防御者,包括:
7、根据攻击者和防御者的速度分别建立攻击者和防御者的动力学方程;
8、基于攻击者和防御者的动力学方程构建值函数;
9、采用伊藤积分对值函数进行泰勒展开,得到概率可达集结果。
10、本发明进一步的技术方案:所述根据攻击者和防御者的速度分别建立攻击者和防御者的动力学方程,具体为:
11、
12、
13、其中,每个攻击者有相同的最大速度va,每个防御者有相同的最大速度vd,ai(·)、dj(·)分别表示攻击者和防御者的控制函数,表示攻击者和防御者确定性部分的动力系统速度;分别表示攻击者和防御者的布朗运动的扰动项,分别为攻击者和防御者初始0时刻的状态。
14、本发明进一步的技术方案:所述基于攻击者和防御者的动力学方程构建值函数,具体为:
15、使最优控制框架与概率密度函数的时间演化相结合,产生概率可达性分析域,概率可达性分析将计算到一定状态的转移概率;值函数将等价于在t=0时刻处于初始集合和在t=t时刻处于最终状态x的条件概率;
16、考虑一个受控的随机过程
17、
18、其中,为攻击队的联合控制输入,为防御队的联合控制输入;集合和分别表示攻击队和防御队的联合容许控制输入集;f(x,u,d)为攻击者和防御者确定性部分的动力系统函数
19、
20、
21、
22、因为动力学是随机的,所以不能最小化值函数;相反,预期的回报在所有可能进一步实现的维纳过程中被最小化
23、
24、设是非空目标集。表示期望;
25、考虑在成功的概率ρ∈[0,1]下的可达集ωt,或初始条件x存在的轨迹在时刻t到达集合的概率集合
26、
27、其中,集合可以通过使用水平集方法来表示
28、
29、其中,
30、如果假设该值函数是可微的,则推导为:
31、
32、其中,是一个零均值过程,呈正态分布,标准差是状态和时间的函数。
33、本发明进一步的技术方案:所述采用伊藤积分对值函数进行泰勒展开,得到概率可达集结果,具体为:
34、由于维纳过程,dx2是dt阶的,所以扩展必须执行到二阶:
35、
36、其中,δx=δf(x,u,d)+ξ。保持所有阶次项利用dynkin算子有:
37、
38、代入v(x,t),再除以δt
39、
40、对于δt→0的极限,值函数由随机汉密尔顿-雅可比-贝尔曼方程的粘度解来表示
41、
42、随机汉密尔顿-雅可比-贝尔曼方程可以用与确定性汉密尔顿-雅可比-贝尔曼方程类似的方法来求解;与确定性可达集相反,概率可达性分析中的值函数不用符号距离函数表示;相反,使用指示函数表示:
43、
44、指示函数的正则化表示为:
45、
46、其中,vε(x)为的lipschitz连续。
47、一种计算机系统,其特征在于包括:一个或多个处理器,计算机可读存储介质,用于存储一个或多个程序,其中,当所述一个或多个程序被所述一个或多个处理器执行时,使得所述一个或多个处理器实现上述的方法。
48、一种计算机可读存储介质,其特征在于存储有计算机可执行指令,所述指令在被执行时用于实现上述的方法。
49、一种计算机程序产品,其特征在于包括计算机可执行指令,所述指令在被执行时用于实现上述的方法。
50、本发明的有益效果在于:
51、本发明提供的一种基于多智能体随机追逃博弈的概率可达集计算方法,可以应用于可达性分析和多智能体追逃博弈中,计算多智能体随机追逃博弈的概率可达集。
52、(1)大多数追逃博弈是在确定性环境下研究的,忽略了系统动力学和环境的不确定性影响。本发明将当前的追逃博弈的解决方法扩展到一个更一般的框架中,并考虑了系统动力学的随机部分。
53、(2)建立随机追逃博弈问题与涉及不连续收益函数的随机最优控制问题之间的联系,并考虑博弈中多个智能体之间的互动。
54、(3)利用概率可达性分析来解决多智能体随机追逃博弈的问题。
1.一种基于多智能体随机追逃博弈的概率可达集计算方法,其特征在于,所述多智能体分为攻击者和防御者,包括:
2.根据权利要求1所述的一种基于多智能体随机追逃博弈的概率可达集计算方法,其特征在于,所述根据攻击者和防御者的速度分别建立攻击者和防御者的动力学方程,具体为:
3.根据权利要求2所述的一种基于多智能体随机追逃博弈的概率可达集计算方法,
4.根据权利要求3所述的一种基于多智能体随机追逃博弈的概率可达集计算方法,其特征在于,所述采用伊藤积分对值函数进行泰勒展开,得到概率可达集结果,具体为:
5.一种计算机系统,其特征在于包括:一个或多个处理器,计算机可读存储介质,用于存储一个或多个程序,其中,当所述一个或多个程序被所述一个或多个处理器执行时,使得所述一个或多个处理器实现权利要求1所述的方法。
6.一种计算机可读存储介质,其特征在于存储有计算机可执行指令,所述指令在被执行时用于实现权利要求1所述的方法。
7.一种计算机程序产品,其特征在于包括计算机可执行指令,所述指令在被执行时用于实现权利要求1所述的方法。
