0 引言
1 相关工作
1.1 传统优化方法
1.2 启发式搜索
1.3 人工智能方法
2 分布式多机任务规划算法
2.1 场景描述
2.2 VM-Net
2.2.1 VM-P中的动作网络
2.2.2 VM-P中的评价网络
2.2.3 VM-M
2.2.4 几何感知奖励
2.3 网络实现细节
2.3.1 训练方法
2.3.2 策略熵奖励正则
2.3.3 动作掩码
2.3.4 基于TD误差的优先回放机制
3 实验
3.1 任务场景介绍
3.1.1 仿真平台
3.1.2 我方飞行器
3.1.3 目标飞行器
3.1.4 危险区域
3.1.5 任务区域
3.1.6 任务类型
3.2 消融实验
3.2.1 智能体动作设计
表1 动作空间类型Table 1 Action space types |
| 序号 | 动作类型 | 动作范围 |
|---|---|---|
| 1 | 飞行距离(km) | 0,0.01,0.03,0.05 |
| 2 | 转弯角度(°) | -0.25,-0.1667,-0.0833,0, 0.0833,0.1667,0.25 |
| 3 | 飞行高度 | 巡航,突围 |
| 4 | 飞行速度 | 巡航,突围 |
| 5 | 原地不动 | 0,1 |
| 6 | 无操作 | 0,1 |
3.2.2 智能体观测空间设计
表2 观测空间类型Table 2 Observation space types |
| 序号 | 观测类型 | 观测范围 |
|---|---|---|
| 1 | Os | [0,1](相对位置、剩余弹药) [-1,1](机头朝向) |
| 2 | Od | [0,1](相对距离) [-1,1](相对角度) |
| 3 | Of | [-1,1](相对位置差、相对距离差、 相对角度差) [0,1](友方剩余弹药) [-1,1](友方机头朝向) |
| 4 | Ot | One-hot编码(任务类型、目标编号) |
3.2.3 目标飞行器策略
3.2.4 网络运行环境
表3 主要训练参数Table 3 Main training parameters |
| 序号 | 种类 | 参数 |
|---|---|---|
| 1 | GPU(训练) | NVIDIA A100 |
| 2 | CPU(训练) | Intel Xeon 6258R |
| 3 | GPU(推理) | NVIDIA 1660Ti |
| 4 | CPU(推理) | Intel Core i5 |
| 5 | 学习率 | 3×10-4(3×10-5,3×10-6) |
| 6 | 批大小 | 64 |