综述、总体、动力、毁伤、测试及其他

基于MADDPG的多无人机协同攻击方法

  • 张波 ,
  • 刘满国 ,
  • 刘梦焱
展开
  • 西安现代控制技术研究所,陕西 西安 710065
刘梦焱(1992—),男,高级工程师,硕士。E-mail:

张波(1999—),男,硕士研究生。E-mail:

收稿日期: 2024-12-30

  网络出版日期: 2025-07-09

A Coordinated Attack Method for Multi-UAV Based on MADDPG

  • ZHANG Bo ,
  • LIU Manguo ,
  • LIU Mengyan
Expand
  • Xi'an Mordern Control Technology Research Institute,Xi'an 710065,Shaanxi,China

Received date: 2024-12-30

  Online published: 2025-07-09

摘要

多无人机协同完成特定打击任务是未来无人机军事领域发展的重要方向。针对多无人机协同攻击问题,构建典型对抗场景。将多无人机协同攻击问题建模成分布式部分可观测马尔可夫决策过程(Dec-POMDP),设计独特奖励函数,采用多智能体深度确定性策略梯度(MADDPG)算法训练攻击策略。使用蒙特卡洛法分析仿真实验,结果表明在该多智能体强化学习算法训练之后,特定对抗场景下多无人机协同攻击任务完成率达到82.9%。

本文引用格式

张波 , 刘满国 , 刘梦焱 . 基于MADDPG的多无人机协同攻击方法[J]. 弹箭与制导学报, 2025 , 45(3) : 344 -350 . DOI: 10.15892/j.cnki.djzdxb.2025.03.011

Abstract

It is an important direction for the future development of UAV military field to coordinated attack of multi-UAV to accomplish specific strike tasks. Aiming at the problem of coordinated attack of multi-UAV, a typical confrontation scenario is constructed. The unmanned aerial vehicle cooperative attack problem is modeled as a decentralized partially observable Markov decision process (Dec-POMDP), and a unique reward function is designed. The multi-agent deep deterministic policy gradient (MADDPG) algorithm is used to train the attack strategy. Monte Carlo method is used to analyze the simulation experiment, and the results show that after the training of the multi-agent reinforcement learning algorithm, the completion rate of the UAV cooperative attack task reaches 82.9% in specific confrontation scenarios.

0 引言

近年来无人机广泛应用于军事领域,在战场侦察、防空压制、协同打击等军事行动中发挥了重要作用,具有成本低、机动性强等特点[1]。无人机作为智能体概念在现实世界最易于实现的映射,多无人机集群网络协同完成特定打击任务,是未来无人机军事领域发展的重要方向。
在这种背景下,需要发挥无人机集群的群体智能优势,在低成本的约束下提升多无人机攻击手段。国内外在无人机集群领域都开展了积极的军用研究,美国国防预先研究计划局(DARPA)曾于2015年推出“小精灵”项目,旨在研究具备自组织和智能协同能力的无人机集群系统[2-3],2017年又提出“进攻性集群战术”(OFFSET)项目,开发应用于城市占场的无人机集群软硬件系统[4]。浙江大学的Fastlab实验室2022年初公布了多无人机蜂群在复杂野外环境中穿行建图的项目进展,实现了稠密复杂地形下无人机蜂群突击构想[5]。以上事例充分说明了研究多无人机攻击控制的价值和必要性。
在解决多无人机协同问题时,强化学习表现出了明显的优势,因为它能够有效应对多无人机面临的高度随机的环境[6]。基于强化学习的多无人机控制算法适应性强,控制决策方法简单,并且能够通过不断学习来优化控制策略,为多无人机提供简单、高效的控制方法[7]
多智能体深度确定性策略梯度算法(multi-agent deep deterministic policy gradient, MADDPG)由Lowe等于2017年提出,将DDPG算法拓展至多智能体领域。MADDPG算法能够处理多个智能体的协作与竞争,适应不同通信机制,同时具备高效性和灵活性[8]
无人机协同攻击过程中主要有以下任务:
1)无人机群需要绕开敌方设置的信号干扰区或者障碍物,不能飞出信号覆盖区,并在避免机间碰撞的基础上抵达任务目标点;
2)在单次任务中需要有足够数量的无人机对既定目标实施打击以保证打击效果。
针对以上无人机协同攻击任务,文中围绕典型对抗场景中的多无人机协同攻击问题展开研究,并以仿真实验分析其效能和必要性。

1 无人机协同攻击模型

1.1 分布式部分可观测马尔可夫决策过程

作为典型的多智能体系统,无人机集群通过选择合适的动作序列来实现将既定任务过程建模成分布式部分可观测马尔可夫决策过程[9](Dec-POMDP)。Dec-POMDP主要用于描述具有局部可观测性和不确定性的多智能体决策场景。
在Dec-POMDP模型下,多无人机协同攻击决策模型可定义为一个元组<U,S,A,P,O,R,H>[10],其中:U={1,2,…,n}是无人机集合,n表示无人机数量;S代表状态空间,是一组状态的集合;A代表联合动作空间,是一组动作的集合;P代表状态转移函数,P(s'i s i,ai)表示无人机在状态si选择动作ai转移到状态s'i的概率;O代表观测函数,是无人机i在状态si下得到的观测Oi的集合;R是奖励函数;H代表决策时间步数集合。
在Dec-POMDP过程中,无人机将各自的动作ai以联合动作A的形式输入到环境中,与环境交互之后将环境状态从S变为S',之后每个无人机从新的整体状态中得到自己的状态,重新输出各自的动作并将上述过程不断迭代更新[11]

1.2 状态空间

i个无人机的状态空间si可表示为:
si=[pi,vi,pT,pIZ,pother,vother]
式中:pi=[xi,yi]表示无人机i的位置信息;vi=[vix,viy]表示无人机i的当前速度信息;pT表示打击目标的位置信息;pIZ表示干扰区的位置信息;pother表示其他无人机的位置信息;vother表示其他无人机的速度信息。
在时刻tk,无人机的状态输入如表1所示。
表1 tk时刻无人机状态变量

Table 1 State variables of UAVs at tk

State parameter Form
pi(tk) [xi(tk),yi(tk)]
vi(tk) [vix(tk),viy(tk)]
pT [xT,yT]
pIZ [xIZ,yIZ]
pother {p1(tk),p2(tk),…,pj(tk),…,pn(tk)}(ji)
vother {v1(tk),v2(tk),…,vj(tk),…,vn(tk)}(ji)

1.3 动作空间

假设无人机的动作序列只发生在二维平面上。在每个时间步tk,无人机i接收X向和Y向的动作组合{Fix(tk),Fiy(tk)}。

1.4 奖励函数

1.4.1 稀疏奖励问题

在统一奖励函数设计过程中,如何解决稀疏奖励问题[12]是强化学习算法自学习过程中必须要考虑的问题。当在强化学习框架中仅存在完成任务和未完成任务两种奖励状态时,该奖励模式就是一种极端稀疏奖励,称为二元奖励[13],二元奖励非常直观且简洁,但是在该奖励机制下,策略网络训练过程会被严重滞缓甚至策略网络根本无法收敛。
为了解决稀疏奖励问题,加快强化学习算法的收敛,另一种方法是在设置全局奖励的基础上引入局部奖励,同时为局部奖励设置阶梯型的奖励函数,引导无人机集群逐步达成全局任务奖励。

1.4.2 奖励函数设计

针对文中所构建的对抗场景,面对特定的攻击任务,设计专用的无人机协同攻击奖励函数。
总奖励函数R可表示为:
R=Rspa+Rpene+Ratt
式中:Rspa为空间任务奖励函数;Rpene为突防任务奖励函数;Ratt打击任务奖励函数。
1)空间任务奖励Rspa
空间任务奖励分为机间避碰奖励和避免飞出任务区奖励,可表示为:
Rspa=kcaRca+kareaRarea
式中:kcaRca对应的系数;kareaRarea对应的系数。
机间碰撞奖励函数具体计算公式为:
Rca= i ri,ca
奖励值设置为:

ri,ca= 10 , d i j 2 0 ,

根据文中无人机实际体积以及飞行时气流的相互影响,无人机默认安全距离设置为2 m。
区域奖励具体计算公式为:
Rarea= i ri,area
xb,yb分别为任务区域的边界,奖励值设置为:

ri,area=
m a x { e z i - z b , 10 } z i = m a x { x i , y i } , z b = { x b   o r   y b } , i f   x i x b   o r   y i y b 0 ,

2)突防任务奖励Rpene
突防任务奖励主要用来引导无人机规避干扰区并接近目标,可表示为:
Rpene=kIZRIZ+kdistRdist
式中kIZ,kdist分别为绕过干扰区和接近目标的奖励函数系数。
碰撞干扰区奖励函数计算公式为:
RIZ= i ri,IZ
奖励值设置为:

ri,IZ= 10 , i f   p i - p I Z δ I Z 0 ,

式中δIZ为干扰区半径。
接近目标的奖励函数计算公式为:
Rdist= i ri,dist
奖励值设置为:

ri,dist= p i - p T

3)打击任务奖励Ratt
打击任务奖励包括击中目标奖励和为了避免稀疏奖励设计的同时到达奖励函数,可表示为:
Ratt=kTRT+kstRst
式中:kT为击中目标奖励函数系数;kst为同时到达奖励函数系数。
击中目标奖励函数计算公式为:
RT= i ri,T
奖励值设置为:

ri,T= 10 , i f   p i - p T δ T 0 ,

式中δT为目标半径。
同时到达奖励函数计算公式为:
Rst=σ
假设有n架无人机,每架无人机与目标点的距离为(d1,d2,…,dn),计算这n架无人机与目标点距离的标准差σ,即为Rst

1.4.3 奖励函数权重

无人机自主协同攻击任务中,上述各奖励函数的权重不同,具体参数设置见表2
表2 奖励函数权重系数

Table 2 Reward function weight coefficient

Coefficient Value
kca -0.5
karea -1
kIZ -0.5
kdist -0.1
kT 1
kst -0.5

2 攻击策略求解

2.1 MADDPG算法架构

MADDPG是一种典型的基于CTDE框架的多智能体强化学习算法[14],通过建立集中式训练,分布式执行的框架,MADDPG解决了多智能体应用中的环境不稳定与动作空间维度爆炸的问题[15]。在MADDPG中,每个智能体分别对应一个Actor网络和一个Critic网络,其中Critic网络的输入为所有智能体的观察信息集合与所有智能体的动作集合。由于获取了所有智能体的观测信息与动作信息,Critic网络能够避免多智能体环境的不稳定性问题,对所有智能体的行为进行稳定的评价[16]。MADDPG算法框架如图1所示。
图1 MADDPG算法框架

Fig.1 MADDPG algorithm framework

基于价值函数的强化学习算法的策略神经网络结构为输入层、隐藏层和输出层,每层包含96个神经元[17]。输入为智能体状态数据,输出为动作,RELU函数作为隐藏层的激活函数。

2.2 算法执行

对于无人机i,将其状态变量输入到其Actor网络中,Actor网络进行探索得到该智能体的动作,依据状态转移函数,动作与环境交互得到新的状态和对应奖励,最后将该智能体的状态、动作、新的状态和奖励作为经验放入自身的经验池D[18]
所有的无人机循环进行这个过程,将得到的经验数据不断地存储到各自的经验池当中。
在更新当前智能体的网络之前,会从每个无人机的经验池中抽取出同一时刻的数据,从而得到新的经验(S,A,R,S')存入到经验池D中,再以小样本方式从经验池中随机采样多个(S,A,R,S')训练各自的神经网络。
tk时刻的经验(S,A,R,S')中:
S={s1(tk),s2(tk),…,sn(tk)},包含所有无人机在tk时刻的状态;A={a1(tk),a2(tk),…,an(tk)}表示在tk时刻无人机做出的动作集合;S'={s'1(tk+1),s'2(tk+1),…,s'n(tk+1)}是tk时刻环境状态S在与动作A交互后得到的下一时刻tk+1的新状态;R={r1(tk),r2(tk),…,rn(tk)}表示所有无人机从环境中得到的回报奖励值。
siS输入到无人机i的Actor网络中得到策略μi(si θ i μ), θ i μ为策略网络参数。为了评估确定无人机动作合集的有效性,Critic网络会对Actor网络的策略进行评价。将SA作为当前无人机i的Critic网络输入,得到评价值Q(S,A θ Q),θQ为评估网络参数。
当前无人机i除了策略网络、评估网络以外,还有目标策略网络(Target-Actor)和目标评估网络 (Target-Critic)。将s'iS'输入到当前无人机i的Target-Actor网络中得到策略μ'i(s'i θ i μ '), θ i μ '为目标策略网络参数。将S'A'作为输入传到Target-Critic网络中,得到下一时刻的Q'(S',A' θ Q ')值,θQ'为目标评估网络参数。

2.3 算法网络更新

通过随机梯度下降法更新每个智能体Actor网络,其表达式为:
  θ i μJ(μi)=ES,A~D( θ i μi(si θ i μ
  a iQ(S,a1,…,an θ Q) a i =   μ i ( s i θ i μ ))
Critic网络最小化损失函数更新为:

L(θQ)=Es,a,r,s'( ( Q ( S , a 1 , , a n θ Q ) - y ) 2),
y=ri+γQ'(S',a'1,…,a'n θ Q ') a ' i = μ ' i ( s ' i θ μ ' i )

使用式(19)软更新目标网络参数:
θ Q ' = τ θ Q + ( 1 - τ ) θ Q ' , θ i μ ' = τ θ i μ + ( 1 - τ ) θ i μ '

2.4 训练算法流程

无人机自主协同攻击训练算法流程为:
1)初始化环境参数,初始化网络参数;
2)获取当前状态S={s1,s2,…,sn},根据策略μi选择动作ai;
3)执行动作集合A={a1,a2,…,an};
4)获得奖励R,得到下一状态S';
5)存储样本(S,A,R,S')进经验池D;
6)更新状态SS';
7)从经验池D随机抽取Batch-size大小的样本(S,A,R,S');
8)更新Critic网络参数θQ和Actor网络参数 θ i μ;
9)软更新Target网络参数。

3 仿真实验

为了验证算法有效性,构建典型的无人机对抗场景。我方无人机攻击班组利用6架无人机对敌方固定目标实施打击。敌方为了防御我方打击,构建了干扰区对我方无人机进行干扰。同时为了有效摧毁敌方目标的物理防御,假设敌方目标单位在承受至少5架无人机的攻击之后才会被摧毁。构建的无人机对抗任务场景示意图如图2所示。
图2 仿真实验场景初始化示意图

Fig.2 Simulation experiment scene initialization

3.1 任务场景参数设置

假定无人机由我方营地出发,出发区域固定,初始坐标随机,为了模拟实际的边长200 m的方形任务区域,仿真场景按比例缩小为2 m的任务区域。具体场景参数设置见表3
表3 任务场景参数值

Table 3 Task scenario parameter values

Parameter Value
Range of task/m {(x,y) x [ - 2,2 ] , y [ - 2,2 ]}
Number of UAVs 6
Range of UAV/m {(x0,y0) x 0 [ - 2,0 ] , y 0 [ - 2,0 ]}
Max speed/(m/s) 0.4
Initial speed/(m/s) 0
Max acceleration/(m/s2) 1
Safe distance/m 0.02
Site of interference/m {(xIZ,yIZ) x I Z = 0 , y I Z = 0}
Interference radius/m 0.5
Site of target/m {(xT,yT) x T = 1.75 , y T = 1.75}

3.2 训练参数设置

训练算法的具体参数设置见表4
表4 MADDPG网络训练参数值

Table 4 MADDPG network training parameter values

Parameter Value
Learning rate (Actor) 0.01
Learning rate (Critic) 0.01
Discount factor 0.99
Soft update 0.01
Batch-size 1 024
Max episode 60 000
Max step 25

3.3 实验结果分析

构建无人机对抗场景,初始化仿真场景设置,包括无人机、干扰区、目标点的位置和作用范围。从以下4个方面对实验结果进行分析。
1)模型训练结果
建立MADDPG模型和深度确定性策略梯度(DDPG)算法模型对无人机进行训练,得到奖励函数曲线,曲线如图3所示。
图3 奖励函数曲线

Fig.3 Reward function curve

由图可以看出随着训练回合数的增加,MADDPG算法和DDPG算法训练得到的累计奖励值在增大。在训练回合数达到10 000之后,MADDPG算法曲线趋于平缓,总体呈现收敛趋势,收敛速度较快。对比可以看出在训练中MADDPG算法模型相比于DDPG算法模型具有更快的收敛速度,并且MADDPG算法模型得到的奖励平均值明显要大于DDPG算法模型得到的奖励平均值。
2)攻击任务完成情况
为了评估无人机协同攻击任务完成情况,对训练完成的MADDPG算法模型进行1 000次蒙特卡洛仿真实验。记录在1 000回合的多无人机协同攻击任务中,每回合成功击中目标的无人机数量,实验结果如图4所示。
图4 每回合击中目标的无人机数量

Fig.4 Simulation results of attack

图4可见,在1 000回合的蒙特卡洛仿真实验中,大多数回合有超过5架无人机击中目标,极少数回合仅有少于5架无人机击中目标,击中目标的无人机数量主要为6架或5架。
3)奖励函数的有效性验证
为了验证设计的奖励函数在避免稀疏奖励问题上的作用,设计消融实验。对没有设计的奖励函数RstRdist的MADDPG算法进行了训练,然后分别进行有奖励函数Rst,Rdist和没有Rst,Rdist的两轮1 000回合的仿真实验。
图5中可以看出,有奖励函数RstRdist的MADDPG算法模型的1 000次仿真实验中,击中目标的无人机数量主要为6架和5架,没有RstRdist的1 000回合仿真实验中,击中目标的无人机数量主要为1架。显而易见,在没有奖励函数RstRdist的训练中,因为稀疏奖励问题算法模型无法收敛。加入设计的奖励函数RstRdist之后算法模型成功收敛,验证了文中设计的奖励函数在避免稀疏奖励问题方面的有效性。
图5 奖励函数RstRdist对打击任务的影响

Fig.5 Impact of reward function Rst and Rdist on performance of attack task

4)打击任务完成率评估
为了量化评估多无人机打击任务完成率,在1 000回合的仿真实验中,对每回合击中目标的无人机数量进行具体统计,实验结果见表5
表5 每回合击中目标的无人机数量

Table 5 Simulation results of attack

Number of UAVs Round
0 0
1 0
2 0
3 22
4 149
5 381
6 448
由仿真实验可以看出,在1 000回合的蒙特卡洛仿真实验中仅有171个回合击中目标的无人机数量是小于5架的。在829个回合中有超过5架无人机成功击中目标。根据以上实验结果和任务评估指标,可以计算得出在文中的对抗场景下,该算法训练的模型进行多无人机协同打击任务的成功率为82.9%。验证了文中算法的有效性。

4 结论

针对多无人机协同攻击问题,构建典型的无人机对抗场景,将多无人协同攻击问题建模为部分可观测马尔可夫决策过程(Dec-POMDP),采用MADDPG算法对无人机自主攻击策略进行训练。设计了能有效避免稀疏奖励问题的无人机协同攻击专用奖励函数。假定了任务评估指标,最后进行蒙特卡洛仿真实验对任务完成率进行分析。仿真结果表明,利用文中算法可以有效解决在特定对抗场景下的无人机协同攻击问题。在算法模型训练之后,特定对抗场景下多无人协同攻击任务完成率达到82.9%。对多智能体算法解决多无人机协同攻击问题具有一定参考价值,未来将在扩展无人机数量和增加对抗场景复杂度方面做更进一步工作。
[1]
黄雷. 美军小精灵无人机群项目发展现状综述[J]. 飞航导弹, 2018(7): 44-47.

HUANG L. Overview of the development status of the U.S. Army's Pixie UAV swarm project[J]. Aerospace Missiles, 2018(7): 44-47.

[2]
王璐菲. DARPA研发“小精灵”无人机用于分布式空中作战[J]. 防务视点, 2015(11): 62-63.

WANG L F. DARPA develops Gremlin UAV for distributed air warfare[J]. Defense Perspectives, 2015(11): 62-63.

[3]
吕震华, 高亢. 美国无人集群城市作战应用发展综述[J]. 中国电子科学研究院学报, 2020, 15(8): 738-745.

LU Z H, GAO K. Review on the development of unmanned cluster urban warfare applications in the United States[J]. Journal of the China Academy of Electronic Science, 2020, 15(8): 738-745.

[4]
QUAN L, YIN L J, XU C, et al. Distributed swarm trajectory optimization for formation flight in dense environments[C]//2022 International Conference on Robotics and Automation (ICRA), June 23-27, 2022, Philadelphia: ICRA, 2022: 4979-4985.

[5]
SUTTON R, BARTO A. 强化学习[M]. 北京: 电子工业出版社, 2019: 15-20.

SUTTON R, BARTO A. Reinforcement learning[M]. Beijing: Publishing House of Electronics Industry, 2019: 15-20.

[6]
邹启杰, 蒋亚军, 高兵, 等. 协作多智能体深度强化学习研究综述[J]. 航空兵器, 2022, 29(6): 78-88.

ZOU Q J, JIANG Y J, GAO B, et al. An overview of cooperative multi-agent deep reinforcement learning[J]. Aero Weaponry, 2022, 29(6): 78-88.

[7]
ARULKUMARAN K, DEISENROTH M P, BRUNDAGE M, et al. Deep reinforcement learning: a brief survey[J]. IEEE Signal Processing Magazine, 2017, 34(6): 26-38.

[8]
张婷婷, 杨学军. 基于强化学习的城市场景下巡飞弹自主协同饱和攻击方法[J]. 指挥与控制学报, 2023, 9(4): 457-468.

ZHANG T T, YANG X J. Autonomous coordination saturation attacks method for loitering munitions in urban scenarios based on reinforcement learning[J]. Journal of Command and Control, 2023, 9(4): 457-468

[9]
仵博. 动态不确定环境下的智能体序贯决策方法及应用研究[D]. 长沙: 中南大学, 2013.

WU B. A sequential decision making method for intelligent bodies under dynamic uncertainty and its application[D]. Changsha: Zhongnan University, 2013.

[10]
谢宇轩. 基于集成学习的多智能体强化学习算法研究[D]. 哈尔滨: 哈尔滨工业大学, 2022.

XIE Y X. Research on multi-agent reinforcement learning algorithm based on ensemble learning[D]. Harbin: Harbin Institute of Technology, 2022.

[11]
尹华一, 尤雅丽, 黄新栋, 等. 基于MADDPG的多AGVs路径规划算法[J]. 厦门理工学院学报, 2024, 32(1): 37-46.

YIN H Y, YOU Y L, HUANG X D, et al. Multi-AGVs path planning algorithm based on MADDPG[J]. Journal of Xiamen University of Technology, 2019, 32(1): 37-46.

[12]
宋明惠. 基于深度强化学习的无人机自主飞行控制算法的研究与实现[D]. 北京: 北京交通大学, 2022.

SONG M H. Research and implementation of UAV autonomous flight control algorithm based on deep reinforcement learning[D]. Beijing: Beijing Jiaotong University, 2022.

[13]
李超, 王瑞星, 黄建忠, 等. 稀疏奖励下基于强化学习的无人集群自主决策与智能协同[J]. 兵工学报, 2023, 44(6): 1537-1546.

DOI

LI C, WANG R X, HUANG J Z, et al. Autonomous decision making and intelligent cooperation of unmanned clusters based on reinforcement learning under sparse reward[J]. Acta Armamentarii, 2023, 44(6): 1537-1546.

[14]
郭宏达, 娄静涛, 杨珍珍, 等. 基于拍卖多智能体深度确定性策略梯度的多无人车分散策略研究[J]. 电子与信息学报, 2024, 46(1): 287-298.

GUO H D, LOU J T, YANG Z Z, et al. Research on multi-unmanned vehicle decentralization strategy based on auction multi-agent depth deterministic strategy gradient[J]. Journal of Electronics and Information Technology, 2019, 46(1): 287-298.

[15]
戴凤琪. 基于深度强化学习的智能体算法研究[D]. 北京: 北京交通大学, 2023.

DAI F Q. Research on agent algorithm based on deep reinforcement learning[D]. Beijing: Beijing Jiaotong Univer-sity, 2023.

[16]
林萌龙, 陈涛, 任棒棒, 等. 基于多智能体深度强化学习的体系任务分配方法[J]. 指挥与控制学报, 2023, 9(1): 93-102.

LIN M L, CHEN T, REN B B, et al. System task assignment method based on multi-agent deep reinforcement Learning[J]. Journal of Command and Control, 2023, 9(1): 93-102.

[17]
李波, 越凯强, 甘志刚, 等. 基于MADDPG的多无人机协同任务决策[J]. 宇航学报, 2021, 42(6): 757-765.

LI B, YUE K Q, GAN Z G, et al. Multi-UAVs collaborative mission decision based on MADDPG[J]. Journal of Astronautics, 2021, 42(6): 757-765.

[18]
杨书恒, 张栋, 任智, 等. 基于多智能体强化学习的无人机集群对抗方法研究[J]. 无人系统技术, 2022, 5(5): 51-62.

YANG S H, ZHANG D, REN Z, et al. Research on UAV swarm confrontation method based on multi-agent reinforcement learning[J]. Unmanned Systems Technology, 2022, 5(5): 51-62.

文章导航

/

tom_cn.htm"-->