Academic article

PPO-based Adaptive Frequency-hopping Anti-jamming Technique for Radar

  • DU Yuxuan 1, 2 ,
  • WU Zhongjie , 2, * ,
  • SONG Sisheng 1 ,
  • ZHANG Jun 2
Expand
  • 1 Xi’an Electronic Engineering Research Institute, Xi’an 710100,Shaanxi, China
  • 2 College of Electronic Science and Technology, National University of Defense Technology, Changsha 410073,Hunan, China

Received date: 2026-01-21

  Online published: 2026-05-09

Abstract

To address the challenge that the frequency-agile radars in the stable tracking phase in modern complex electromagnetic environments struggle have difficulty in balancing both coherent integration gain and anti-jamming capability under blanket jamming,this paper proposes a joint control method for frequency and dwell time based on proximal policy optimization (PPO).Firstly,the trade-off relationship between radar coherent integration gain and intercept risk is analyzed.The dynamic combined jamming behavior of jammers is modeled,and a Markov decision process model for radar anti-jamming,incorporating signal-level feature feedback,is constructed.Secondly,the PPO algorithm is introduced.A compound reward function that takes into account both detection performance and survivability is designed,enabling the radar agent to autonomously learn the optimal strategy in unknown dynamical adversarial environments.This strategy can adjust the operating frequency and dwell time in real-time based on environmental feedback to maximize the signal-to-interference-plus-noise ratio.Simulated results demonstrate that,compared to traditional strategies,the proposed strategy can effectively evade the combined blanket jamming.It significantly reduces the probability of being jammed while substantially improving the output SINR,exhibiting strong environmental adaptability and robustness.

Cite this article

DU Yuxuan , WU Zhongjie , SONG Sisheng , ZHANG Jun . PPO-based Adaptive Frequency-hopping Anti-jamming Technique for Radar[J]. Journal of Projectiles, Rockets, Missiles and Guidance, 2026 , 46(2) : 162 -171 . DOI: 10.15892/j.cnki.djzdxb.2026.02.005

0 引言

随着有源干扰样式向多样化、协同化与智能化方向的演进,雷达系统生存与探测能力正面临日益严峻的挑战。频率捷变(Frequency Agile,FA)作为一项经典的雷达抗干扰技术,在抗侦察截获、抗有源压制干扰等方面效果显著[1-3]。然而,在多种压制干扰并存且动态时变的频谱环境中,传统的随机跳频策略因缺乏对频谱的认知与自主响应能力,而难以充分发挥频率分集带来的优势。具备环境频谱感知和智能发射频点决策能力的FA雷达是未来的发展趋势。
认知雷达是雷达智能化的一种范式,其概念由Simon Haykin教授[4]在2006提出。认知雷达的核心特点是“感知-行动循环”的闭环处理机制,即雷达能够持续地从与环境的交互中学习,并据此实时调整雷达发射波形与信号处理方法。在复杂动态电磁对抗环境中,认知雷达能够实现抗干扰资源的优化配置和环境敏捷适应,理论上能够带来雷达抗干扰性能质的飞跃。强化学习(Reinforcement Learning,RL)为认知雷达基于环境信息反馈的序贯决策提供了技术路径。作为机器学习的一个重要分支,RL通过“试错”机制与环境交互,以追求长期累积奖励最大化为目标来优化决策策略,这一“感知-学习-决策”的循环与认知雷达的核心思想高度契合[5]。传统强化学习在应对高维、复杂的电磁状态空间时,其决策能力常受限于特征表征瓶颈。近年来兴起的深度强化学习(Deep Reinforcement Learning,DRL),通过引入深度神经网络作为强大的函数逼近器,有效克服了这一障碍,实现了从感知到决策的端到端优化[6]。正是这种对复杂环境更强的感知与驾驭能力,使得DRL相较于其前身,成为实现认知雷达智能更为理想和关键的技术途径。
文献[7]提出了一种基于Q学习的认知雷达对抗系统,通过自主学习实现最优干扰策略的确定,促进了RL在雷达对抗中的初步探索。随后,文献[8]进一步提出智能雷达对抗概念,结合Q学习算法显著提升了系统的自适应能力。近年来,众多学者研究了RL在雷达抗干扰策略优化中的应用。汪浩等[9]针对雷达副瓣进入的连续波干扰、脉冲干扰及转发干扰的复合干扰场景,分别采用Q-learning[10]与Sarsa算法迭代更新抗干扰知识库。此外,文献[11]针对传统雷达对抗过程中单一功能和实时性能较差的问题,将RL应用于雷达发射功率的优化分配,尽管其状态空间较为简化,但为资源调度提供了新思路。近年来,针对FA雷达的研究逐渐成为主流。文献[12]以雷达发射行为与回波信干比为状态输入,分别采用Q-learning与DQN[13]算法优化认知雷达的跳频策略,显著提升了在干扰环境下的频率选择能力。在此基础上,文献[14]设计了一种基于DQN的FA雷达抗干扰方法,通过将历史发射行为序列化作为状态输入,进一步实现了跳频决策的智能化。
尽管上述研究在频域决策优化方面取得了积极进展[15-19],但存在以下不足:一是主要基于静态或简单随机的干扰环境假设,普遍缺乏对具备雷达信号截获感知与能力的智能干扰机行为的考虑。更关键的是,多数研究仅停留在单一的频率选择层面,尚未深入探究跳频间隔这一时域维度的优化问题,从而忽视了相干积累增益与被截获风险之间核心的制约关系。此外,现有模型多基于简化的数值特征而非真实的信号级反馈,难以充分表征复杂电磁环境下的动态博弈态势,限制了算法在实战场景中的泛化能力与鲁棒性。
在实际作战流程中,雷达完成目标捕获并转入跟踪阶段后,如何维持高精度的连续观测至关重要。本文的研究场景设定为雷达已完成目标截获并进入跟踪模式。基于此前提,本文针对一般脉冲级频率捷变雷达,考虑了一种更符合实战环境的驻留时间敏感型干扰策略,并研究了基于近端策略优化(Proximal Policy Optimization,PPO)的雷达自适应跳频与驻留时间联合控制问题。本文的主要贡献总结如下:
(1)建立了基于信号级反馈的雷达抗干扰马尔可夫决策过程(Markov Decision Processes,MDP)模型。通过建立多维信号特征状态空间和频率选择动作空间,将雷达抗干扰问题建模为序列决策问题。不同于传统基于抽象概率的模型,本模型集成了波形生成、脉冲压缩等真实信号处理流程,使雷达对环境的观测直接源于信号处理结果。为后续策略优化奠定了高保真基础。
(2)设计了一种灵活的权衡机制来平衡雷达的相干积累效率和抗干扰生存能力。高相干积累增益和低被截获概率对雷达来说都很重要,但二者存在内生矛盾:即前者需要长时间驻留,而后者需要快速跳频。因此,在MDP的奖励函数中引入了一种动态权衡机制,考虑了瞬时的信干噪比,使得雷达能够根据当前的干扰情况,自主调整其在特定频点的最佳驻留脉冲。
(3)在RL理论框架下实现了动态对抗环境下的最优跳频驻留策略优化。应用PPO算法来学习动态变化的干扰环境下的最优策略,智能体通过识别干扰机特征,在干扰机即将完成参数识别并实施压制干扰的时刻,主动打破驻留模式进行跳频,显著提升了雷达在强对抗环境下的稳健性。

1 雷达信号模型

1.1 FA雷达发射信号模型

FA雷达指各发射脉冲载频频率在带宽范围内按某种规律快速变化的一种脉冲体制雷达[20]。基于认知雷达架构,FA雷达能够在每个相干处理间隔内根据电磁环境态势自适应选择工作频点,实现有限频谱资源的最优分配[21]
本文所考虑的FA雷达可以在脉冲间进行频率捷变。令F={f1,f2,…,fM}表示雷达所有可用的载波频率的集合,其中M为频点总数。令k∈{0,1,2,…,K-1},表示雷达工作的离散时间步,K为一个相干处理间隔内的总脉冲数,每步对应于一个脉冲重复周期(Pulse Repetition Interval,PRI)Tr。在第k个时间步,雷达智能体将根据当前观测状态决策一个载波频率f(k)∈F进行发射。因此,雷达发射脉冲串可以表示为
$s\left(t\right)=\sum _{k=0}^{+\infty }u(t-k{T}_{r}){e}^{j2\pi {f}^{\left(k\right)}t}$
在式中,u(t)是雷达基带发射波形,不失一般性地,令u(t)为线性调频信号,即
u(t)=rect $\left(\frac{t-{T}_{p}/2}{{T}_{p}}\right){e}^{j\frac{\pi B{t}^{2}}{{T}_{p}}}$
其中,Tp为信号脉冲宽度,B为信号带宽,rect(·)表示矩形窗函数,其定义为
rect(t)= $\left\{\begin{array}{ll}1,& \left|t\right|\le \frac{{T}_{p}}{2}\\ 0,& \left|t\right|>\frac{{T}_{p}}{2}\end{array}\right.$
在每个时间步,雷达智能体既可以选择与上一步相同的频点,也可以选择一个新的频点。定义n(k)为截至k时刻,雷达在某频点上的连续驻留脉冲数,其更新规则为
n(k)= $\left\{\begin{array}{ll}{n}^{(k-1)}+1,& if {f}^{\left(k\right)}={f}^{(k-1)}\\ 1,& if {f}^{\left(k\right)}\ne {f}^{(k-1)}\end{array}\right.$
雷达发射信号的示意如图1所示,从图中可知,不仅仅雷达发射中心频率在脉冲间是捷变,雷达在每个频点上的驻留时间也是不固定的。
图1 FA雷达模型

Fig.1 Frequency agile radar model

1.2 FA雷达接收信号模型

在第k个时间步,雷达接收到的基带信号为
${r}^{\left(k\right)}\left(t\right)={a}_{0}u\left(t\right)+\sum _{i=1}^{N}{a}_{i}{J}_{i}\left(t\right)+w\left(t\right)$
其中:a0u(t)为目标回波,鉴于本文研究聚焦于跟踪状态下的抗干扰策略,假设接收机已通过距离波门技术完成了回波对齐,即将时间轴原点锁定在预测的目标到达时刻。因此,针对目标距离单元内的信号分析,可将其时延等效为0;w(t)为接收机热噪声与环境背景噪声的总和;Ji(t),i=1,…,N表示进入雷达天线的第i个干扰信号,ai表示干扰幅度衰减因子,其取值正比于干扰信号和目标信号重叠带宽ΔBJi的均方根,即
an $\sqrt{\frac{\Delta {B}_{{J}_{n}}}{{B}_{{J}_{n}}}}$
$\Delta {B}_{{J}_{i}}=\int rect\left(\frac{f-{f}_{{J}_{i}}}{{B}_{{J}_{i}}}\right)rect\left(\frac{f-{f}^{\left(k\right)}}{B}\right)df$
其中,fJiBJi分别为第n个干扰信号的中心频率和带宽。
不失一般性地,假设环境中存在两种噪声压制干扰:
一类是阻塞式干扰,其压制带宽通常为数百MHz到数GHz,中心频点固定或缓慢变化。阻塞式干扰无需精确的频率引导,可形成区域性频谱压制,对窄范围频率跳变的雷达具有良好的压制效果。
一类是瞄准式干扰,其压制带宽通常仅为目标信号的1.2~1.5倍,中心频点需要与目标信号中心频点对齐。因此,瞄准式干扰需要精确的频谱侦察和频率引导,对慢速频率跳变的雷达具有良好的压制效果。现代大功率干扰机通常采用“侦察-干扰”循环交替的半双工模式,在侦察窗口内进行环境电磁信号的接收、测量、分选和识别,然后在干扰窗口内发射干扰信号。因此,雷达在一个发射频点上驻留得越久,被干扰的风险就越大。本文用驻留时间-干扰概率模型描述干扰机的行为,定义条件概率为
$P_{\text {jam }}(n) \triangleq \mathbb{P}\{H \mid N=n\}$
其中,
$ H \triangleq\{ 雷达在下一个脉冲被干扰 \} $
$\{N=n\} \triangleq\{\text { 雷达在某频点上已连续发射 } n \text { 个脉冲 }\} $
Pjam(n)可以在满足如下条件前提下任意设置:
$\begin{array}{l}{P}_{jam}\left(0\right)={P}_{min},{P}_{jam}\left(\infty \right)={P}_{max}\le 1\\ {P}_{jam}(n+1)\ge {P}_{jam}\left(n\right)\end{array}$
其中,Pmin表示干扰机“盲”干扰成功的概率,Pmax为干扰机干扰成功的最大概率。
针对上述阻塞式干扰和瞄准式干扰并存的场景,雷达应采取宽带跳频、快速跳频相结合的频率捷变方案。由于跳频间隔大会导致雷达失去相参积累的能力,雷达相参积累脉冲数受制于雷达的频点驻留时间。尽管快速跳频有利于规避干扰,但也降低了相参积累时间,导致较低的信干噪比。因此,雷达跳频决策必须考虑跳频速度和相参积累时间的权衡。

1.3 FA雷达信号处理和SINR估计

对于雷达接收脉冲基带信号r(k)(t),k=1,2,…,按照如下步骤进行信号处理:
1)对每个基带回波r(k)(t)使用h(t)=u*(-t)进行匹配滤波,得到匹配滤波输出:
$y^{(k)}(t)=r^{(k)}(t) \otimes u^{*}(-t)$
2)将雷达在某个频点上连续驻留的一段时间作为相参处理周期(Coherent Processing Interval,CPI),对相同发射频点的连续雷达回波做相参积累,得到相参积累结果。
3)对不同频点回波的处理结果进行非相参积累,最后完成目标检测。
在上述过程中,雷达每次接收到一个脉冲都需要基于脉冲匹配滤波结果估计SINR,用于后续的发射决策。假设雷达已经锁定目标所在的距离单元,记该距离单元处的匹配滤波输出幅度为y(k)(t0),则目标加干扰的功率水平估计值为
$\hat{P}_{T+J}^{(k)}=\left|y^{(k)}\left(t_{0}\right)\right|^{2}$
使用单元平均法估计干扰功率水平,在目标所在距离单元两侧各设置一定数量的参考单元,则干扰功率水平的估计值为
$\hat{P}_{J}^{(k)}=\frac{1}{|\Upsilon|} \sum_{i \in Y}\left|y^{(k)}\left(t_{i}\right)\right|^{2}$
其中,Υ表示参考单元索引的集合,|Υ|表示参考单元的个数。第k个脉冲回波的SINR估计为
ρ(k)= $\frac{{\hat{P}}_{T+J}^{\left(k\right)}-{\hat{P}}_{J}^{\left(k\right)}}{{\hat{P}}_{J}^{\left(k\right)}}$
考虑相参积累增益等于积累脉冲数,可以根据单个脉冲回波的SINR估计相参积累后的SINR,按下式计算:
SINR(k)= $\left\{\begin{array}{ll}SINR(k-1)+\rho \left(k\right),& if {f}^{\left(k\right)}={f}^{(k-1)}\\ \rho \left(k\right),& if {f}^{\left(k\right)}\ne {f}^{(k-1)}\end{array}\right.$
由上式可知,跳频将会导致雷达的相参积累增益“清零”,这反应了对雷达跳频的惩罚。

2 基于PPO的智能跳频策略

本文的核心目标是寻找最优的频率选择序列与动态驻留时长,以在复杂的电磁对抗环境中实现相干积累增益与抗干扰能力的最佳平衡。然而,这一优化问题极具挑战性,因为雷达通常无法预知干扰机的具体截获参数及其动态攻击策略。在动态电子战环境中,雷达的每一次发射决策都会影响干扰机随后的行为,进而影响雷达下一时刻的探测性能。上述过程在数学上自然契合MDP的描述框架。而RL为解决此类环境模型未知的序列决策问题提供了强有力的数学工具,前提是将该问题合理建模为MDP。如图2是基于DRL的雷达抗压制干扰MDP模型。
图2 基于DRL的雷达抗干扰MDP模型

Fig.2 DRL-based MDP model for radar anti-jamming

本节详细构建了包含信号级特征状态与时域动作的雷达抗干扰MDP模型,将抗干扰问题形式化为策略优化问题,推导出能够自适应应对动态组合干扰的雷达最优跳频驻留策略,并给出自适应跳频策略的完整执行流程。

2.1 基于MDP的抗干扰问题建模

一个标准的MDP通常由一个五元组(S,A,P,R,γ)定义[22],在本研究的雷达智能抗干扰的应用背景下,将MDP理论框架具体化为以下模型要素:
(1)状态空间S:环境所有可能状态的集合。stS表示智能体在时刻t对环境的观测。在本文中构建了一个多维特征状态向量。时刻t的状态st定义为:st= $[n,{f}_{idx},SINR,{\delta }_{trend},{\rho }_{jam}{]}^{T}$具体含义如下:
驻留时间n:反映当前频点的连续驻留脉冲数,表征相干积累进程。。
频率索引fidx:标识雷达当前在频谱中的工作位置,用于区分不同频段的干扰分布。
瞬时SINR:当前时刻的信干噪比,反映当前时刻的探测性能质量。
SINR趋势项δtrend:表示SINR的历史变化斜率,利用最近3回合SINR计算的一阶差分,反映干扰环境的动态变化,该特征用于捕捉干扰机切入或切出的动态过程。
历史干扰率ρjam:统计历史窗口内的被干扰频率,辅助判断环境对抗强度,该特征用于记忆干扰机的长期行为模式。
(2)动作空间A:智能体可执行的所有决策的集合。atA表示时刻t采取的动作。在本文中,动作空间定义为雷达所有可用载波频率的离散集合:A={1,2,…,M}其中M为可用频点数。本模型包含显式与隐式两层决策含义:
显式决策:选择下一时刻的具体频率f(t|1)
隐式决策:若at=at-1,雷达选择“保持”,当前CPI延续,驻留时间增加,相干积累增益提升。若atat-1,雷达选择“切换”,当前CPI结束,驻留时间重置为1,以规避潜在的干扰锁定。
(3)奖励函数R:奖励函数的设计是引导智能体学习最优策略的核心。对于雷达侧,深入分析了跳频间隔的变化对相干积累增益和被干扰风险的综合影响。提出了一种复合型的奖励函数,即时奖励rt由两个部分加权组成:
rt=rbase+rswitch
其中,基础效能奖励rbase直接与当前的SINR值相关,定义为
rbase= $\left\{\begin{array}{ll}SINR& SINR\ge {r}_{th}\\ -10,& SINR{<r}_{th}\end{array}\right.$
其中,rth为通过对已训练的数据进行统计计算出的阈值。而rswitch为切换/保持奖励,基于环境反馈的策略性奖励,正比于跳频次数,以抑制无效频繁跳频。
(4)状态转移概率 :描述环境动力学的函数。(s'|s,a)=Pr(st+1=s'|st=s,at=a),表示在状态s执行动作a后转移到状态s'的概率。在本文建立的雷达对抗场景中,状态转移概率P(st+1|st,at)取决于环境规律及干扰机的对抗策略。由于干扰机的策略通常是非平稳且未知的,智能体无法预知确切的转移概率,必须通过强化学习算法在交互中进行采样估计。
(5)折扣因子$\gamma: \gamma \in[0,1)$用于权衡即时奖励与长期未来回报的重要性。
强化学习的目标是寻找一个最优策略π*(a|s),使得从任意初始状态出发的期望累积折现回报最大化:
$J(\pi)=\mathbb{E}_{\pi}\left[\sum_{k=0}^{\infty} \gamma^{k} r_{t+k}\right]$
面对上述高动态、非平稳的对抗环境,传统的规则型跳频策略难以适应。本章提出一种基于深度强化学习的智能跳频方案,利用PPO算法实现雷达策略的自适应演进。

2.2 PPO算法实现

鉴于前述雷达抗干扰MDP模型具有状态空间连续、环境动态非平稳以及对策略稳定性要求极高的特点,传统的基于值函数的方法如Q-learning或DQN往往难以在策略更新的剧烈震荡中收敛到最优解。因此,本文采用PPO算法作为核心求解器。
作为一种基于Actor-Critic架构的策略梯度算法,PPO通过引入裁剪代理目标函数来限制每次迭代中策略更新的步长。这种机制不仅克服了原始策略梯度方法中步长难以确定的缺陷,更保证了雷达抗干扰策略在训练过程中的单调提升与样本效率,使其能够从有限的信号级交互数据中快速、稳定地学习到应对动态组合干扰的最优驻留与跳频逻辑。其核心PPO算法的核心在于优化以下剪切目标函数:
$L^{C L I P}(\theta)=\hat{\mathbb{E}}_{t}\left[\min \left(r_{t}(\theta) \hat{A}_{t}, \operatorname{clip}\left(r_{t}(\theta), 1-\varepsilon, 1+\varepsilon\right) \hat{A}_{t}\right)\right]$
其中,rt(θ)是新旧策略的概率比率, ${\hat{A}}_{t}$是利用广义优势估计计算出的优势函数,该机制限制了每次迭代中策略更新的步长,防止因更新过大导致策略崩溃,从而保证了雷达抗干扰策略训练的单调收敛与鲁棒性。
本文具体的算法如算法 1所示,执行流程结合了上述MDP模型与PPO优化过程,实现了从环境交互数据收集到策略网络参数更新的闭环学习。
算法1 基于PPO的自适应跳频抗干扰策略

Algorithm 1 PPO-based adaptive frequency-hopping anti-jamming strategy

算法1:基于PPO的自适应跳频抗干扰策略
输入:雷达参数(带宽B,可用频率集合F),PPO超参数(学习率α,折现因子γ,裁剪阈值ε),最大训练回合数K。
输出:最优策略网络 ${\pi }_{\theta }^{*}$
1:初始化:Actor网络参数θ与Critic网络参数φ;经验回放缓冲区D。
2:for回合episode=1 to K do
3: 重置环境状态s0(包括驻留时间n(0)、频率索引及SINR历史);
4: for时间步t=1 to Tmax do
5: //阶段1:环境交互与数据收集
6: 从信号处理模块观测当前状态st;
7: 根据当前策略采样动作atθ(·|st)(选择下一时刻频率);
8: 执行动作at:更新当前频点的驻留时间n;生成雷达发射信号与干扰机响应;执行脉冲压缩与相干积累计算SINR;
9: 计算即时奖励rt并观测下一状态st+1;
10: 将转移样本(st,at,rt,st+1)存入缓冲区D;
11: if缓冲区D已满then
12: //阶段2:PPO策略更新
13: 使用GAE方法计算优势函数估计值 ${\hat{A}}_{t}$;
14: for训练轮次epoch=1 to Nepoch do
15: 通过最大化裁剪目标函数LCLIP(θ)更新Actor参数θ;
16: 通过最小化价值损失函数LVF(Φ)更新Critic参数Φ;
17: end for
18: 清空缓冲区D;
19: end if
20: if满足终止条件(如SINR过低或达到最大步数)then break;
21: end for
22:end for

3 实验结果

为了验证所提基于PPO的雷达自适应跳频方法的有效性,本文在Matlab环境下搭建了雷达与干扰机对抗的仿真平台。

3.1 仿真环境与参数设置

实验模拟雷达与智能干扰机的动态博弈过程。在每个回合的初始化阶段,预设雷达已完成对目标的搜索捕获,智能体的任务是在随后的跟踪维持过程中,通过自适应调整发射频率和驻留时长,对抗干扰机的瞄准与压制,保持波门内目标回波的信干噪比水平。具体的雷达与干扰机参数设定如下所示。表1表2分别总结了雷达和干扰机的仿真参数,表3总结了PPO算法的超参数。
表1 雷达发射信号仿真参数表

Table 1 Radar transmit signal simulation parameters

参数类型 数值/描述
信号类型 LFM
工作频段 3.0-4.0GHz
可选频点数量 10
带宽 20MHz
脉宽 10μs
采样率 50MHz
脉冲重复频率 1000Hz
最大脉冲数 16
表2 压制干扰信号仿真参数表

Table 2 Jamming signal simulation parameters

参数类型 数值/描述
干扰调制类型 噪声调频干扰
瞄准干扰带宽 50MHz
瞄准干扰初始概率 0.1
瞄准干扰概率增长系数 0.05
阻塞干扰带宽 200MHz
阻塞干扰数目 1
表3 PPO算法超参数表

Table 3 PPO algorithm hyperparameters

参数类型 数值
折扣因子 0.95
GAE因子 0.95
Clip因子 0.2
熵损失权重 0.01
训练回合数 500
单回合最大步数 100
MiniBatch大小 16

3.2 训练过程收敛性分析

智能体训练过程中的奖励变化如图3所示,观察可知,在训练初期随着智能体对环境的探索,奖励曲线呈现显著上升趋势,表明策略正在快速优化。在约200回合后,曲线逐渐趋于平稳,且后期波动方差较小,无明显的性能坍塌或发散现象。这验证了所提PPO算法在动态干扰环境下的收敛性与鲁棒性。此外,所有训练回合均达到了环境规定的最大步数(曲线未展示步数,因为始终保持在最大值),进一步证明了智能体在全过程中具备极高的生存率。
图3 PPO训练奖励曲线

Fig.3 PPO training reward convergence curve

3.3 基于PPO的决策有效性分析

通过提取训练收敛后的单次测试回合数据,从时频域行为与能量域增益两个维度对智能体的“驻留-跳变”策略进行微观分析。
图4展示了PPO智能体在50个时间步内的频率选择序列。从图中可以清晰地观察到智能体习得的策略:智能体在全过程中完全避开了固定干扰频点,主要在远离干扰的频点之间切换。这表明智能体通过与环境的交互,准确识别了固定干扰频段,验证了奖励函数中对进入固定干扰区进行惩罚的有效性。
图4 PPO智能体频点选择序列

Fig.4 Frequency point selection sequence of PPO agent

轨迹显示,智能体并非进行无序的随机跳频,而是表现出明显的阶梯状轨迹。智能体倾向于在某一频点连续驻留若干个时间步,随后快速切换至另一非固定干扰频点,短暂驻留后再次切回。这种行为模式与预先定义的瞄准式干扰机模型高度吻合。智能体学会了在接近临界阈值Nth前主动停止驻留,重置干扰机的侦察状态。图中标注的跳变时刻呈现出高度的周期性,证明智能体已掌握了干扰机的时间演进规律。
图5所示,展示了在本文设定的干扰模型下,驻留时间对干扰概率与相干积累增益的双重影响。图6进一步量化了上述策略带来的相干积累增益变化情况。增益曲线呈现出规则的“线性上升-瞬间回零”的锯齿状形态。上升阶段对应于图4中的水平驻留段。随着驻留时间增加,增益呈对数规律累积。
图5 收益与干扰风险平衡

Fig.5 Trade-off between integration gain and jamming risk

图6 相干积累增益变化曲线

Fig.6 Variationl curve of coherent integration gain

回零阶段对应于频率切换时刻。一旦切换频率,驻留计数器重置为1,增益归零。这种模式直观地反映了智能体在利用时间换取增益的过程。图中虚线标示了最大理论增益,综合上述两图结果显示,智能体的实际增益峰值未达到理论最大值。这一现象并非算法收敛不足,而是智能体基于本文设定的“驻留时间-干扰概率”耦合模型做出的最优决策。具体而言,干扰机的截获与锁定概率随着雷达驻留时间的增加而单调上升。在驻留初期,干扰锁定概率较低,继续驻留带来的相干增益提升大于被干扰的风险,因此智能体选择“保持”。当驻留时间接近干扰机的反应临界时间时,干扰机的截获与锁定概率急剧上升。此时,若强行追求最大的理论增益,将面临极高的被干扰风险,导致最终SINR大幅恶化。
因此,PPO智能体习得的策略是在干扰锁定概率激增前主动中断驻留并切换频率。这种的策略虽然牺牲了部分理论增益,但极大地提升了生存概率,从而在长周期统计上实现了期望SINR的最大化。这也直接印证了算法成功在相干积累收益与被干扰风险之间找到了平衡点。

3.4 算法性能对比

本节设计对比实验,包括三种典型策略:
(1)PPO智能体策略:基于PPO的自适应跳频与驻留控制策略;
(2)DQN智能体策略:基于DQN的自适应跳频策略;
(3)固定驻留策略Fixed-N:在单频驻留N个脉冲后强制跳频,作为规则基准。
所有算法在统一环境下进行蒙特卡洛测试,共200回合,关键环境参数及临界干扰门限一致。

3.4.1 训练收敛性能对比

本实验旨在探究不同频谱环境复杂度下,PPO与DQN两种算法在抗干扰决策中的性能差异。实验设计了三个递增的复杂度场景:
场景1:10个可用频点,1个阻塞式干扰源。
场景2:50个可用频点,2个阻塞式干扰源。
场景3:100个可用频点,3个阻塞式干扰源。
不同场景下PPO算法与DQN收敛性能如图7所示,PPO算法在收敛速度与最终回报稳定性上均显著优于DQN。与前文收敛性分析实验结果相似,在三种场景下,训练初期,PPO通过策略梯度优化快速提升平均奖励,并于150回合左右进入稳定平台期。相比之下,DQN的奖励曲线波动剧烈,且最终收敛的回报值较低。这是由于雷达抗干扰环境具有典型的非平稳性,干扰机的动态响应导致状态转移概率不断变化。图7(a)表明,由于动作空间较小,状态-动作对的遍历相对容易,DQN和PPO但在低维空间下都能稳定收敛。两者由于很容易避开唯一的阻塞式干扰源并掌握动态干扰的触发规律,但DQN收敛后的平均奖励低于PPO。
图7 不同场景下PPO算法与DQN收敛性能

Fig.7 Convergence performances of PPO and DQN algorithms under different scenarios

随着可选频点数增加,动作空间稀疏性增加,算法表现开始出现分化。如图7(b)图7(c)所示,此时,DQN的收敛曲线开始出现震荡。这是由于随着环境复杂度提升,DQN可能陷入局部最优,导致其稳定性开始下降,PPO基于策略梯度,更擅长处理连续或大规模离散动作空间,故PPO展现出更好的策略平滑性,在动作空间不断扩大的同时依旧能完成收敛。符合前文所分析的预期效果。
上述实验数据表明,PPO算法在动作空间扩大时表现出更强的可扩展性。DQN适合低维决策,但在高维频谱决策中,其价值函数的拟合难度上升,导致收敛慢且不稳定。

3.4.2 测试平均SINR性能对比

三种场景下测试阶段的平均SINR趋势结果如图8所示,通过对比三组不同环境复杂度下的全局SINR趋势曲线,可以观察到显著且一致的性能差异。
图8 不同算法下全局平均SINR

Fig.8 Average SINR of different algorithms

图8(a)所示,在仅有10个频点时,阻塞式干扰机的存在使得Fixed-N这种固定驻留策略极易被锁定,导致性能急剧下降。而DQN体现出了学习能力,通过避开干扰从而获得稳定的SINR,但由于对干扰的时序特征学习不足,导致无法在干扰环境下进行相干积累,进一步提升SINR。
图8(b)图8(c)表明,随着动作空间的扩展,Fixed-N和DQN始终维持在稳定值,但此时平均SINR骤降至0-2dB区间。
在上述性能分析的基础上,在场景3的环境中,三种策略的蒙特卡洛测试中单回合的统计分布结果如图9所示,图中纵轴代表平均SINR,横轴代表被干扰概率。该图综合了三种策略在被干扰风险与SINR收益之间的权衡关系,通过统计分布揭示了上述性能差异的内在机理。PPO策略的样本点高度集中于左上角区域即高SINR与低干扰概率,其被干扰概率控制在20%以下。相比之下,Fixed-N策略的样本点散布于高干扰概率区间,说明传统策略在面对具备感知能力的干扰机时生存力匮乏,而DQN则由于陷入了局部最优,使其保持低干扰概率的同时无法进行持续积累,从而导致其SINR无法得到充分提升。这验证了PPO通过优化复合奖励函数,实现了对干扰环境特征的有效学习,在确保探测效能的同时提升了自身抗干扰能力。
图9 被干扰概率和SINR综合图

Fig.9 Probability of jamming and SINR

3.4.3 雷达系统级效能评估与检测概率分析

为了验证所提PPO算法在雷达实际作战任务中的有效性,本文引入了系统级关键性能指标:检测概率Pd进行评估。设定虚警率概率PFA=10-6图10展示了不同策略下的雷达目标检测概率对比,具体分析如下:
图10 雷达目标检测概率对比

Fig.10 Radar target detection probability

所提PPO算法取得了最高的检测概率(80.4%),显著优于DQN算法(66.9%)。这表明PPO算法通过Actor-Critic架构更有效地平衡了“频域干扰规避”与“时域相干积累”的博弈关系,能够在复杂的电磁环境中锁定安全的时间窗口进行能量积累。
随机跳频策略虽然具有较强的抗干扰截获能力,但其检测概率仅为47.1%。原因在于随机策略缺乏驻留机制,频繁跳频打断了雷达的相干处理,导致回波能量积累不足;固定驻留策略的表现最差,检测概率仅为8.4%。这是因为该策略缺乏对环境威胁的感知能力,极易长时间锁定在被干扰的频点上,尤其是面对多频点固定干扰源时,导致信干比急剧恶化。相比之下,PPO算法能够敏锐识别干扰频点并主动规避,体现了极强的环境适应性。

4 结论

本文围绕现代复杂电磁环境下捷变频雷达所面临的动态组合干扰威胁,系统地提出并验证了一种基于PPO算法的雷达自适应跳频与驻留时间联合控制抗干扰新策略。综合全文研究,实验结果表明,在目标跟踪场景下,所提PPO智能体能够主动感知和规避复杂干扰模式,不仅较大幅度提升了SINR和增益利用率,同时有效降低了被干扰概率,兼顾了雷达探测效能与系统生存力。无论是对比传统固定策略还是基于DQN的跳频策略,PPO方案均呈现出更优的综合性能和稳定性,显示出深度强化学习为雷达自适应抗干扰带来的巨大优势。本方法具备良好的环境适应性与鲁棒性,能够顺利应对具备策略自适应能力的动态干扰机,对实际应用中不断演化的电子对抗场景具有现实应用意义。
[1]
全英汇, 方文, 沙明辉, 等. 频率捷变雷达波形对抗技术现状与展望[J]. 系统工程与电子技术, 2021, 43(11):3126-3136.

DOI

QUAN Y H, FANG W, SHA M H, et al. Present situation and prospects of frequency agility radar wave form countermeasures[J]. Systems Engineering and Electronics, 2021, 43(11):3126-3136.

[2]
全英汇, 方文, 高霞, 等. 捷变频雷达导引头技术现状与发展趋势[J]. 航空兵器, 2021, 28(3):1-9.

QUAN Y H, FANG W, GAO X, et al. Review on frequency agile radar seeker[J]. Aero Weaponry, 2021, 28(3):1-9.

[3]
AXELSSON S R J. Analysis of random step frequency radar and comparison with experiments[J]. IEEE Transactions on Geoscience and Remote Sensing, 2007, 45(4):890-904.

DOI

[4]
HAYKIN S. Cognitive radar:a way of the future[J]. IEEE Signal Processing Magazine, 2006, 23(1):30-40.

[5]
陈舒波. 基于深度强化学习的雷达抗有源干扰决策方法研究[D]. 成都: 电子科技大学, 2025.

CHEN S B. Research on radar anti-active interference decision method based on deep reinforcement learning[D]. Chengdu: University of Electronic Science and Technology of China, 2025.

[6]
刘全, 翟建伟, 章宗长, 等. 深度强化学习综述[J]. 计算机学报, 2018, 41(1):1-27.

LIU Q, ZHAI J W, ZHANG Z Z, et al. A survey on deep reinforcement learning[J]. Chinese Journal of Computers, 2018, 41(1):1-27.

[7]
李云杰, 朱云鹏, 高梅国. 基于Q-学习算法的认知雷达对抗过程设计[J]. 北京理工大学学报, 2015, 35(11):1194-1199.

LI Y J, ZHU Y P, GAO M G. Design of cognitive radar jamming based on Q-learning algorithm[J]. Transactions of Beijing Institute of Technology, 2015, 35(11):1194-1199.

[8]
邢强, 贾鑫, 朱卫纲. 基于Q-学习的智能雷达对抗[J]. 系统工程与电子技术, 2018, 40(5):1031-1035.

XING Q, JIA X, ZHU W G. Intelligent radar countermeasure based on Q-learning[J]. Systems Engineering and Electronics, 2018, 40(5):1031-1035.

[9]
汪浩, 王峰. 强化学习算法在雷达智能抗干扰中的应用[J]. 现代雷达, 2020, 42(3):40-44.

WANG H, WANG F. Application of reinforcement learning algorithms in anti-jamming of intelligent radar[J]. Modern Radar, 2020, 42(3):40-44.

[10]
SUTTON R S, BARTO A G. Reinforcement learning:an introduction[M]. 2nd ed. Cambridge,MA,US: MIT Press, 2018.

[11]
XING Q, ZHU W G, JIA X. Research on method of intelligent radar confrontation based on reinforcement learning[C]// Proceedings of the 2017 2nd IEEE International Conference on Computational Intelligence and Applications (ICCIA).Beijing, CN:IEEE, 2017:471-475.

[12]
LI K, JIU B, LIU H W, et al. Reinforcement learning based anti-jamming frequency hopping strategies design for cognitive radar[C]// Proceedings of the 2018 IEEE International Conference on Signal Processing,Communications and Computing (ICSPCC).Qingdao,CN:IEEE, 2018:1-5.

[13]
MNIH V, KAVUKCUOGLU K, SILVER D, et al. Human-level control through deep reinforcement learning[J]. Nature, 2015, 518(7540):529-533.

DOI

[14]
LI K, JIU B, LIU H W. Deep Q-network based anti-jamming strategy design for frequency agile radar[C]// Proceedings of the 2019 International Radar Conference (RADAR).Toulon, FRA:IEEE, 2019:1-5.

[15]
WANG SS, LIU Z, XIE R, et al. Reinforcement learning for compressed sensing based frequency agile radar in the presence of active interference[J]. Remote Sensing, 2022, 14(4):968.

DOI

[16]
LI X Z, DONG S B. Research on efficient reinforcement learning for adaptive frequency-agility radar[J]. Sensors, 2021, 21(23):7931.

DOI

[17]
AILIYA , YI W, VARSHNEY P K. , Adaptation of frequency hopping interval for radar anti-jamming based on reinforcement learning[J]. IEEE Transactions on Vehicular Technology, 2022, 71(12):12434-12449.

DOI

[18]
FANG YY, ZHANG L, WEI S P, et al. Online frequency-agile strategy for radar detection based on constrained combinatorial nonstationary bandit[J]. IEEE Transactions on Aerospace and Electronic Systems, 2023, 59(2):1693-1706.

[19]
LIU P F, LIU Y M, HUANG T Y, et al. Decentralized automotive radar spectrum allocation to avoid mutual interference using reinforcement learning[J]. IEEE Transactions on Aerospace and Electronic Systems, 2021, 57(1):190-205.

DOI

[20]
WATERS W M, LINDE G J. Frequency-agile radar signal processing[J]. IEEE Transactions on Aerospace andElectronic Systems, 1979, AES-15(3):459-464.

[21]
解烽, 刘环宇, 胡锡坤, 等. 基于复数域深度强化学习的多干扰场景雷达抗干扰方法[J]. 雷达学报, 2023, 12(6):1290-1304.

XIE F, LIU H Y, HU X K, et al. A radar anti-jamming method under multi-jamming scenarios based on deep reinforcement learning in complex domains[J]. Journal of Radars, 2023, 12(6):1290-1304.

[22]
李康, 纠博, 赵宇, 等. 雷达智能博弈抗干扰技术综述与展望[J]. 现代雷达, 2023, 45(5):15-26.

LI K, JIU B, ZHAO Y, et al. Overview and prospects of radar intelligent game-based anti-jamming technology[J]. Modern Radar, 2023, 45(5):15-26.

Outlines

/