0 引言
1 无人机协同攻击模型
1.1 分布式部分可观测马尔可夫决策过程
1.2 状态空间
表1 tk时刻无人机状态变量Table 1 State variables of UAVs at tk |
| State parameter | Form |
|---|---|
| pi(tk) | [xi(tk),yi(tk)] |
| vi(tk) | [vix(tk),viy(tk)] |
| pT | [xT,yT] |
| pIZ | [xIZ,yIZ] |
| pother | {p1(tk),p2(tk),…,pj(tk),…,pn(tk)}(j≠i) |
| vother | {v1(tk),v2(tk),…,vj(tk),…,vn(tk)}(j≠i) |
1.3 动作空间
1.4 奖励函数
1.4.1 稀疏奖励问题
1.4.2 奖励函数设计
ri,ca=
ri,area=
ri,IZ=
ri,dist=
ri,T=
1.4.3 奖励函数权重
表2 奖励函数权重系数Table 2 Reward function weight coefficient |
| Coefficient | Value |
|---|---|
| kca | -0.5 |
| karea | -1 |
| kIZ | -0.5 |
| kdist | -0.1 |
| kT | 1 |
| kst | -0.5 |
2 攻击策略求解
2.1 MADDPG算法架构
2.2 算法执行
2.3 算法网络更新
∇ Q(S,a1,…,an ) )
L(θQ)=Es,a,r,s'( ),
y=ri+γQ'(S',a'1,…,a'n )
2.4 训练算法流程
3 仿真实验
3.1 任务场景参数设置
表3 任务场景参数值Table 3 Task scenario parameter values |
| Parameter | Value |
|---|---|
| Range of task/m | {(x,y) } |
| Number of UAVs | 6 |
| Range of UAV/m | {(x0,y0) } |
| Max speed/(m/s) | 0.4 |
| Initial speed/(m/s) | 0 |
| Max acceleration/(m/s2) | 1 |
| Safe distance/m | 0.02 |
| Site of interference/m | {(xIZ,yIZ) } |
| Interference radius/m | 0.5 |
| Site of target/m | {(xT,yT) } |
3.2 训练参数设置
表4 MADDPG网络训练参数值Table 4 MADDPG network training parameter values |
| Parameter | Value |
|---|---|
| Learning rate (Actor) | 0.01 |
| Learning rate (Critic) | 0.01 |
| Discount factor | 0.99 |
| Soft update | 0.01 |
| Batch-size | 1 024 |
| Max episode | 60 000 |
| Max step | 25 |
3.3 实验结果分析
表5 每回合击中目标的无人机数量Table 5 Simulation results of attack |
| Number of UAVs | Round |
|---|---|
| 0 | 0 |
| 1 | 0 |
| 2 | 0 |
| 3 | 22 |
| 4 | 149 |
| 5 | 381 |
| 6 | 448 |