0 引言
1 雷达信号模型
1.1 FA雷达发射信号模型
1.2 FA雷达接收信号模型
1.3 FA雷达信号处理和SINR估计
2 基于PPO的智能跳频策略
2.1 基于MDP的抗干扰问题建模
2.2 PPO算法实现
算法1 基于PPO的自适应跳频抗干扰策略Algorithm 1 PPO-based adaptive frequency-hopping anti-jamming strategy |
| 算法1:基于PPO的自适应跳频抗干扰策略 |
|---|
| 输入:雷达参数(带宽B,可用频率集合F),PPO超参数(学习率α,折现因子γ,裁剪阈值ε),最大训练回合数K。 输出:最优策略网络 1:初始化:Actor网络参数θ与Critic网络参数φ;经验回放缓冲区D。 2:for回合episode=1 to K do 3: 重置环境状态s0(包括驻留时间n(0)、频率索引及SINR历史); 4: for时间步t=1 to Tmax do 5: //阶段1:环境交互与数据收集 6: 从信号处理模块观测当前状态st; 7: 根据当前策略采样动作at~πθ(·|st)(选择下一时刻频率); 8: 执行动作at:更新当前频点的驻留时间n;生成雷达发射信号与干扰机响应;执行脉冲压缩与相干积累计算SINR; 9: 计算即时奖励rt并观测下一状态st+1; 10: 将转移样本(st,at,rt,st+1)存入缓冲区D; 11: if缓冲区D已满then 12: //阶段2:PPO策略更新 13: 使用GAE方法计算优势函数估计值 14: for训练轮次epoch=1 to Nepoch do 15: 通过最大化裁剪目标函数LCLIP(θ)更新Actor参数θ; 16: 通过最小化价值损失函数LVF(Φ)更新Critic参数Φ; 17: end for 18: 清空缓冲区D; 19: end if 20: if满足终止条件(如SINR过低或达到最大步数)then break; 21: end for 22:end for |
3 实验结果
3.1 仿真环境与参数设置
表1 雷达发射信号仿真参数表Table 1 Radar transmit signal simulation parameters |
| 参数类型 | 数值/描述 |
|---|---|
| 信号类型 | LFM |
| 工作频段 | 3.0-4.0GHz |
| 可选频点数量 | 10 |
| 带宽 | 20MHz |
| 脉宽 | 10μs |
| 采样率 | 50MHz |
| 脉冲重复频率 | 1000Hz |
| 最大脉冲数 | 16 |
表2 压制干扰信号仿真参数表Table 2 Jamming signal simulation parameters |
| 参数类型 | 数值/描述 |
|---|---|
| 干扰调制类型 | 噪声调频干扰 |
| 瞄准干扰带宽 | 50MHz |
| 瞄准干扰初始概率 | 0.1 |
| 瞄准干扰概率增长系数 | 0.05 |
| 阻塞干扰带宽 | 200MHz |
| 阻塞干扰数目 | 1 |
表3 PPO算法超参数表Table 3 PPO algorithm hyperparameters |
| 参数类型 | 数值 |
|---|---|
| 折扣因子 | 0.95 |
| GAE因子 | 0.95 |
| Clip因子 | 0.2 |
| 熵损失权重 | 0.01 |
| 训练回合数 | 500 |
| 单回合最大步数 | 100 |
| MiniBatch大小 | 16 |