A Chinese Named Entity Recognition Method Based on Multi-feature Fusion for UAV Communication Domain

  • PENG Zhenni 1 ,
  • FAN Rui , 2, * ,
  • YANG Xintong 2 ,
  • LEI Lei 3
Expand
  • 1 Fundamental Experimental Teaching Department, Nanjing 211106,Jiangsu, China
  • 2 College of Electronic and Information Engineering, Nanjing University of Aeronautics and Astronautics, Nanjing 211106,Jiangsu, China
  • 3 College of Astronautics, Nanjing University of Aeronautics and Astronautics, Nanjing 211106,Jiangsu, China

Received date: 2025-12-23

  Online published: 2026-06-29

Abstract

Aiming at the problems of insufficient samples, semantic ambiguity and blurred entity boundaries in Chinese named entity recognition for UAV communication, this paper proposes a multifeature fusion Chinese named entity recognition model RCPAC (roberta-wwm-ext-large-CNN-PositionAwareAttention-BiLSTM-CRF). Firstly, the UAV communication domain dictionary is dynamically integrated into the robertawwmextlarge model to obtain global features fused with domainspecific lexical information. A SqueezeandExcitation Networks (SENet) attention mechanism is introduced into the Convolutional Neural Network (CNN) layer to extraction key feature. Within the bidirectional positionaware attention mechanism, two regiondivided forward and backward attention modules are designed to capture entity boundary features. Then, dynamic weightbased fusion is conducted on the global features with lexical information, multiscale local features extracted by the CNN layer, as well as position information and entity features obtained from the bidirectional positionaware attention mechanism. Next, the Bidirectional Long ShortTerm Memory (BiLSTM) layer is used to model longrange sequence dependencies and filter redundant features. Finally, the Conditional Random Fields (CRF) decoding layer outputs the optimal label sequence. Comparative experiments and ablation experiments verify the effectiveness and superiority of the proposed model. On the selfconstructed smallscale UAV communication dataset, the F1score of the RCPAC model is improved by 1.01%-9.95% compared with other baseline models. In addition, the model achieves F1scores of 92.15% and 95.56% on the CCKS2021 Chinese address element parsing dataset and the MSRA dataset respectively, demonstrating its generalization ability and effectiveness.

Cite this article

PENG Zhenni , FAN Rui , YANG Xintong , LEI Lei . A Chinese Named Entity Recognition Method Based on Multi-feature Fusion for UAV Communication Domain[J]. Journal of Projectiles, Rockets, Missiles and Guidance, 2026 , 46(3) : 225 -236 . DOI: 10.15892/j.cnki.djzdxb.2026.03.001

0 引言

在无人机通信领域的文本处理中,命名实体识别(Named Entity Recognition,NER)是实现智能化文本信息提取的基础,是构建无人机通信领域知识图谱、实现智能问答、辅助技术分析的核心前提。NER可以将无人机通信领域非结构化文本,例如技术手册、实验报告、专利文献等中的关键信息提取为结构化的 “实体-类型”对,例如“正交频分复用-调制方式”,让零散的文本数据转化为可复用、可查询的结构化知识。无人机在远程控制、任务调度、态势感知、故障诊断等环节均涉及无人机通信技术,处理这些无人机通信数据,可以提高人机信息交互质量和效率。但是无人机通信技术专业性强、数据量大,人工提取关键实体耗时耗力且易出错,而NER技术通过对无人机通信数据的结构化解析,可以促进“自然语言指令”与“无人机执行逻辑”的连接,提升数据处理效率。近年来,基于预训练语言模型(如BERT、RoBERTa)的方法通过迁移学习有效捕捉了上下文语义关联,大幅提升了实体识别的准确率[1]。文献[2]使用BERT-BiLSTM-CRF模型来解决地址实体模糊性和复杂性的问题。文献[3]将roberta-wwm-ext-large嵌入模型运用到医疗实体识别,比使用BERT基础模型的F1值高出1.49%。随着深度学习技术的发展,研究者们提出将注意力机制运用到命名实体识别。文献[4]提出多重注意力机制来优化模型提取的全局特征。文献[5]使用注意力机制动态融合全局特特征和BiLSTM模型提取的特征。
尽管上述方法在上下文建模取得成效,但在专业领域,通用NER模型难以捕获领域内专业术语信息。为此,研究者们引入领域词典嵌入,以增强模型对专业术语的理解能力。文献[6]利用外部构建的实体词典,为模型提供先验实体知识。当前,为了充分利用不同粒度、不同来源的特征信息,出现了层级特征融合策略,文献[7]将CNN提取的局部特征与BiLSTM提取的序列特征融合,来丰富语义特征。文献[8]通过注意力机制融合图结构与上下文语义特征。
命名实体识别在无人机相关领域也有进展。文献[9]将CRF模型用于无人机领域的命名实体标注。文献[10]提出将BERT模型用于无人机配送系统中的地址解析。然而,无人机通信领域命名实体识别面临着挑战,一是语义易混淆,例如同一词汇在不同语境下含义不同,像“链路”可能指“通信链路”或“数据链路”,需要结合上下文才能准确判断;二是实体边界模糊,无人机通信领域术语具有多样性,实体的起始和结束位置难以清晰界定。此外,无人机通信属于交叉领域,高质量标注数据需兼具通信与无人机专业知识,人工标注成本高,公开语料库匮乏,限制了监督学习模型的训练效果。
针对上述挑战,本文基于roberta-wwm-ext-large提出一种多特征动态权重融合的无人机通信领域中文命名实体识别模型RCPAC,目前多特征动态权重融合技术多面向通用场景,存在特征无领域针对性和权重分配无明确物理意义的局限。而RCPAC模型将领域信息融入特征动态融合技术,特征选择依据领域信息,融入领域增强语义特征即融合无人机通信领域专业词典;并且RCPAC模型的动态权重计算融合领域规则与数据驱动,将术语领域相关性、实体长度、边界置信度等纳入权重因子,让分配逻辑可解释,融合过程设计场景触发机制,根据实体类型动态调整权重策略。此外,RCPAC模型的双向位置感知注意力机制与传统注意力机制不同,传统注意力机制具有对称性,不能区分位置信息的方向,而RCPAC模型则包括前向和后向不同方向信息来源,能够更好提取位置信息,减少实体边界模糊的问题。
RCPAC模型包括四方面的改进,一是领域语义增强模块,将自主构建的无人机通信专业词典与预训练词向量动态融合,解决通用模型对无人机通信领域术语表征模糊的问题,相较于其它直接使用通用嵌入的模型,本文使用动态权重融合嵌入,提升语义区分度;二是CNN多尺度特征融合,在CNN 提取局部n-gram特征的基础上,引入了SENet通道注意力增强关键特征,并使用门控残差连接保留原始语义,提升局部语义敏感性,过滤冗余特征,缓解梯度消失,使得局部特征提取更精准;三是引入改进双向位置感知注意力机制,通过实体边界权重动态调节前向和后向序列融合比例,解决传统多尺度特征融合中“实体边界模糊”的共性难题,还融入相对位置编码和实体类型嵌入来强化实体边界感知,使得位置信息的表征精度优于传统注意力机制使模型四是通过动态特征融合层,同时捕捉全局语义、局部n-gram、位置与边界三大核心特征,且通过动态权重融合实现“按需聚焦”,减少语义混淆的问题。此外,本文以无人机通信领域相关图书、网上数据、 手工整理数据为基础,构建一个质量较优的无人机通信方面的数据集,以弥补无人机通信领域公开数据的不足。

1 RCPAC模型

本文提出了基于无人机通信领域的中文命名实体识别模型RCPAC,其主要从领域适配、多特征提取和多特征动态融合三方面来解决无人机通信领域命名实体识别语义易混淆和实体边界模糊的问题。图1为本文提出模型的总体结构图,主要包含融合无人机领域专业术语词典信息的roberta-wwm-ext-large嵌入层、CNN局部特征提取层、双向位置感知注意力实体边界捕捉、多特征动态权重融合层、BiLSTM过滤层和CRF解码层6个部分。
图1 RCPAC模型总体框架

Fig.1 The overall framework of RCPAC model

RCPAC模型中文文本命名实体识别的过程如下:
1)首先是领域适配,通过roberta-wwm-ext-large嵌入模型提取上下文相关的词向量,然后将自主构建的无人机领域词典与嵌入模型输出词向量动态融合,提升模型对无人机领域专业术语的识别精度并减少语义混淆的问题。
2)通过CNN层提取融合词典信息特征的词向量的局部特征,依次使用不同核大小的卷积层,每个卷积后接挤压和激励网络注意力机制、门控机制和残差连接,以此来捕捉局部n-gram特征,增强模型对局部语义特征的敏感性。
3)针对实体边界模糊的问题,本文设计了双向多头注意力机制来增强位置感知。其通过双向注意力融合前向和后向序列信息,并引入实体边界权重控制融合比例,增强了模型对实体边界的感知性能,同时结合相对位置编码和实体类型嵌入来增强上下文感知。
4)针对专业术语语义易混淆的问题,RCPAC模型进行了多特征动态融合,将融合词信息的全局语义特征、CNN局部特征和注意力位置特征进行动态权重融合,使模型可以根据不同于语义特点自动调整关注焦点,经过多粒度特征提取来避免语义混淆。
5)使用BiLSTM层过滤掉不重要的特征,增强模型对序列顺序建模的能力。
6)最后,通过CRF解码层的维比特算法优化标注序列输出。

1.1 无人机领域词典信息融合嵌入层

本文使用roberta-wwm-ext-large嵌入模型来获得输入信息的向量表示。roberta-wwm-ext-large在多项中文自然语言处理任务上超越了BERT、RoBERTa等其他先进的嵌入模型.其包含的全词掩码(whole word masking,wwm)策略能够获得词级别的语义表示,可减少中文文本信息的丢失[11]。roberta-wwm-ext-large包含24层Transformer[12],每层Transformer都包含16头自注意力。定义输入句子为S={x1x2,…,xn},其中xn表示句子中的第n个字。在句子的起始位置加入[CLS]标签,在句子的结尾加入[SEP]标签,经过嵌入模型roberta-wwm-ext-large处理后得到输入句子的初始向量表示为{E0E1E2,…,EnEn+1}。
将无人机领域词典通过 token索引嵌入映射,并与roberta-wwm-ext-large嵌入维度对齐,然后将嵌入模型输出特征与无人机领域词典特征按照动态权重融合,融合权重weight计算公式如下:
weight=σ(bert·Ww+bw)∈ℝB×L×1
其中,Ww∈ℝD×1为权重计算的全连接层权重,bw∈ℝ1为偏置项,σ为sigmoid函数,确保权重范围在[0,1]之间。
roberta-wwm-ext-large嵌入特征与无人机领域词典特征按照动态权重融合,最终输出为
E=bert☉weight+domain☉(1-weight)
其中,☉表示逐元素乘法,1-weight为领域特征权重,与bert特征权重互补,和为1。

1.2 双向位置感知注意力实体边界捕捉

传统的位置感知注意力机制常使用自注意力机制方法来进行序列建模,其具有对称性,会造成每个位置同时关注句子中所有其他位置的信息,从而不能区分不同方向的语义[13]。相比传统位置感知注意力机制,本文设计的双向位置感知注意力机制原理框图如图2所示,在注意力分数计算中直接融入实体信息和相对位置信息,使模型能够更准确捕捉上下文位置信息和实体语义信息。嵌入层输出为E∈ℝB×L×CB为批量大小,L为序列长度,C=1024为通道数),则注意力分数计算公式如下:
score(ij)=$\frac{{q}_{i}{k}_{j}^{T}}{\sqrt{{d}_{k}}}$+Eij)·a+relpos(ij)·b
其中,ab是实体和位置的可学习权重。
图2 双向位置感知注意力原理框图

Fig.2 Principle block diagram of bidirectional position-aware attention

此外,传统的注意力前向、后向序列信息按固定比例融合(如简单平均),无针对性调节。而本文设计的双向位置感知注意力机制包括前向和后向注意力两个模块,通过实体边界预测来动态控制前后向注意力权重,按“实体结构”精准划分关注范围,聚焦实体内部关键依赖,前后向权重计算公式:
αfwij)=α·Softmax(score(ij)·Iji))
αbwij)=(1-α)·Softmax(score(ij)·Ij>i))
其中,α通过模型从输入特征中学习得到,后向注意力是前向注意力的对键序列反转,进行双向融合得到最终位置感知特征输出:
${F}_{pos}={\sum }_{j}({\alpha }_{fw}(i,j)+{\alpha }_{bw}(i,j))·{v}_{j}$

1.3 CNN局部特征提取层

本文利用CNN结合SENet通道注意力增强关键特征,并使用门控残差连接保留原始语义,通过不同卷积核捕捉文本的多粒度局部特征。在保留roberta-wwm-ext-large全局语义的基础上,弥补了Transformer在局部细节捕捉上的不足[14-15]。通过嵌入层给出的文本向量表示为E∈RB×L×C,则卷积核为W∈RK×C×FK为核大小,F为输出通道数),卷积层通过不同大小的核(3,5,7,9)捕获不同尺度的局部特征,公式表达如下:
${y}_{i}=GELU\left(\sum _{k=0}^{K-1}{E}_{i+k}*{W}_{k}+b\right)$
其中,y∈ℝB×L×F为输出特征,GELU为激活函数,b为偏置项。
然后,通过SENet通道注意力对多尺度特征进行通道级注意力加权,突出关键特征;门控残差连接则融合原始特征与增强特征,缓解梯度消失。SENet注意力,即对拼接后的多尺度特征Fconcat=[y1y2y3y4]先压缩、再激发得到通道权重c
c=sigmoid(W2·ReLU(W1·AvgPool(Fconcat))+b2)+b1
通过通道权重与原始卷积特征逐元素相乘得到重要通道Fatt,每个通道的特征会被对应的权重c缩放,权重值越接近1,为重要通道被增强;接近0,为冗余通道被抑制。
门控残差连接是通过权重g融合原始特征与注意力加权后的特征,g从特征中学习得到,实现动态权重调整,得到最终的CNN局部特征:
Fcnn=gFatt+(1-g)☉Fconcat

1.4 多特征动态权重融合层

本文依据无人机领域词信息嵌入的全局语义特征、CNN多尺度局部特征与位置特征,设计了多特征动态权重融合层,将不同来源、不同层次的语义信息(全局、局部、位置、结构)结合,提升了模型对复杂语义的理解。具体融合过程如图3所示,首先将词信息嵌入的全局语义特征、CNN提取的局部特征、以及实体感知注意力提取的位置特征进行两两交互,用逐元素乘法融合多尺度CNN特征与位置特征,增强局部关键信息;使用交叉注意力融合局部位置特征和词信息嵌入的全局语义特征,以此来捕捉两种特征的全局关联;然后将词信息嵌入的全局语义特征、局部融合特征、交叉注意力特征在通道维度拼接,为后续权重学习提供完整特征信息。接着,通过时间分布式,为序列中每个位置计算3个特征的融合权重,并通过softmax函数确保权重归一化,特征融合权重的公式如下:
wi=weights[bl,:]=softmax(fused[bl,:]·Qw+bw
其中,i=0,1,2分别代表三个特征权重,Qw∈ℝ3D×3为全连接层权重,bw∈ℝ3为偏置。
图3 多特征动态权重融合过程图

Fig.3 Multi-feature dynamic weight fusion process

最后,将每个位置的3个特征按对应权重加权求和,得到最终融合特征。

1.5 BiLSTM过滤层

BiLSTM是双向架构的LSTM,LSTM引入了门控单元来控制细胞状态的更新和信息的传递,其可以通过双向传播同时考虑过去和未来上下文[16]。本文采用双向长短期记忆网络进一步建模序列依赖,同时过滤掉一些不重要的特征,以优化模型特征提取。特征融合层输出的向量表示e输入BiLSTM层后的计算公式如下:
$\left[\begin{array}{l}{i}_{i}\\ {o}_{i}\\ {f}_{i}\\ {\stackrel{~}{c}}_{i}\end{array}\right]$=$\left[\begin{array}{l}\sigma \\ \sigma \\ \sigma \\ tanh\end{array}\right]\left(W\left[\begin{array}{l}{e}_{i}\\ {h}_{i-1}\end{array}\right]+b\right)$
ci=fici-1+ii☉${\stackrel{~}{c}}_{i}$
hi=oi☉tanh(ci
hiBilstm=[$\overrightarrow{{h}_{i}}$,$\overleftarrow{{h}_{i}}$]
其中: iioifi分别表示i时刻的输入门、输出门、 遗忘门;${\stackrel{~}{c}}_{i}$ci为计算的中间结果;Wb为参数;hi-1表示前一时刻输入ei-1的隐藏层输出;σ为 Sigmoid激活函数;☉表示逐点乘积。

1.6 CRF解码层

CRF是一种判别式的概率图模型,用于标注和分割序列数据。本文通过CRF建模标签序列的全局依赖关系,可以有效地优化模型的输出[17]。对于标签序列,定义其概率为
$p(y|s)=\frac{exp\left({\sum }_{i}^{}({o}_{i,{y}_{i}}+{T}_{{y}_{i-1},{y}_{i}})\right)}{{\sum }_{\stackrel{~}{y}}^{}exp\left({\sum }_{i}^{}({o}_{i,{\stackrel{~}{y}}_{i}}+{T}_{{\stackrel{~}{y}}_{i-1},{\stackrel{~}{y}}_{i}})\right)}$
其中,Tyi-1,yi表示从标签yi-1到标签yi的转移分数;oi,yi表示字符xi被预测为标签yi的分数; $\stackrel{~}{y}$表示所有可能的标签序列。
在解码时,使用维特比算法来找到获得最高分数的标签序列y*,其计算公式为
${y}^{*}=argmax{\sum }_{i}^{}({o}_{i,{y}_{i}}+{T}_{{y}_{i-1},{y}_{i}})$

2 无人机通信领域数据集构建

2.1 数据收集

本文自主构建了无人机通信领域的数据库,主要以《无人机系统概论》[18]和《无人机集群-智能组网与协同》[19]两本教材作为主要数据来源。数据内容包含无人机的概念及分类、无人机集群组网、网络体系结构、协同控制架构、路由协议、航迹规划算法等方面的知识,为本文的无人机通信数据集构建提供了可靠的数据来源。此外还在多个网站收集了一些关于无人机通信方面的问题作为数据,包括百度、知乎、新华网等。经过筛选,总共收集了1500多份文本作为本文的数据集。

2.2 数据处理

为了更好的训练模型,筛选出的数据需要进行去重、缺失文本处理、特殊字符处理和异常文本过滤。数据去重是剔除重复样本,避免模型训练时因重复数据产生偏差。缺失文本处理是确保数据完整性,若缺失比例大于5%,直接删除缺失样本,并把数据整理为统一格式的文本数据。特殊字符处理是删除或替换无效符号,例如乱码、多余空格、冗余字符和某些错误符号。异常文本过滤是删除文本过长或过短的样本,以及剔除纯数字、纯符号文本或与无人机无关的内容,保证每个句子长度小于200字。通过使用Python程序,找出这些特殊字符并修改可识别出的错误,清除无效值和数据整理。

2.3 实体标注

本文采用BIOES标注策略[20],标注示例如图4所示。采用半人工标注方式,先使用文本标注工具doccano对无人机通信文本进行标注,然后进行人工修改以进一步提升数据集的质量。总共标注了4370个实体,包括无人机类型、无人机集群、网络层次结构、网络协议、航迹规划算法、调制方式、路由协议、媒体访问控制协议、传感器、应用场景10种实体类别。各类实体标注标签、示例及个数如表1所示。
图4 文本标注示例

Fig.4 Text annotation example

表1 实体标注标签及示例

Table 1 Entity annotation labels and examples

Entity
Category
Label Examples Count
无人机类型 DRONE 无人机、UAV、无人飞行器、固定翼无人机、多旋翼无人机、无人直升机 1181
无人机集群 DRONE_
CLUSTER
无人机集群、多无人机系统、集群、自组织协同、无人机编队 1080
网络层次
结构
NETWORK_
LAYER
物理层、数据链路层、网络层、传输层、会话层 333
网络协议 PROTOCOL TCP/IP、OSI/RM、FANET、MANET、MAC协议、TDMA 676
路径规划
算法
ALGORITHM 深度学习、Dijkstra算法、A*算法、遗传算法、粒子群算法 180
调制方式 MODULATION ASK、FSK、PSK、QPSK、QAM、16QAM、振幅键控 337
路由协议 ROUTING_
PROTOCOL
DSDV、WRP、DSR、AODV、ZRP、MPGR、LAROD 129
媒体访问
控制协议
MAC_
PROTOCOL
TDMA、CSMA、CSMA/CD、CSMA/CA、MACA、DCF 124
传感器 SENSOR 传感器、摄像头、合成孔径雷达、激光雷达、红外传感器 157
应用场景 APPLICATION 军事、民用、农业植保、快递运输、物流、农业 174

2.4 数据集分布

本文将数据集划分为训练集、验证集和测试集,将1453条数据分配于训练集,使模型能够充分学习无人机通信数据集特征,74条数据作为验证集,检验模型泛化能力,55条数据用于验证模型性能,作为测试集。为了进一步验证模型在其他领域的适用性以及模型在大规模数据集的性能,本文使用阿里天池大赛中CCKS2021中文地址要素解析数据集和MSRA数据集来训练模型,CCKS2021为CCKS官方测评数据集,数据集质量较高,且其包含10类实体类型,可精准定位模型在“不同粒度实体”上的泛化表现,优于仅提供粗分类别的通用 NER 数据集,该数据集包含20000条数据,训练、测试集和验证集按照8:1:1的比例进行训练,数据格式采用了BIOES的标注方式。MSRA数据集包含3类实体类型,适合用于验证基础模型的核心能力,它的语料集中、格式统一,其训练集约46364个句子,测试集约4365个句子。

3 实验结果与分析

3.1 实验设置

本实验处理器为11th Gen Intel(R) Core(TM) i5-1135G7@2.40GHz,显卡为NVIDIA GeForce MX450,内存为16GB,开发环境为Python3.7.4,操作系统为Windows 11。实验采用roberta-wwm-ext-large模型对数据集进行预训练处理,最终得到1024维的向量表示。
实验参数设置如表2所示。最大序列长度设置为200,来平衡领域文本长度与计算效率。领域词典包含5000个专业术语,词典覆盖95%以上无人机通信核心术语。改进的双向注意力机制实体边界权重系数设置为0.4,经交叉验证在0.3-0.5区间性能最优,经过多次实验测试将注意力头数设置为8,其平衡了并行计算能力与语义捕捉。学习率适配预训练模型微调,批量大小匹配GPU显存。训练轮数设置为10,如图5所示,当训练轮数达到10时,模型性能达到最优。
表2 实验参数设置

Table 2 Experimental parameter settings

超参数
批次大小 8
训练轮数 10
丢弃率 0.5
学习率 5e-5
最大句子长度 200
优化器 Adam
LSTM单元数 128
卷积核大小 (3,5,7,9)
卷积核数量 256
词典大小 5000
注意力头数 8
实体边界权重系数 0.4
图5 模型性能随训练轮数的变化

Fig.5 Model performance vs.training epochs

3.2 评测指标

本文采用精确率(P)、召回率(R)和 F1值三个指标对模型进行评估,它们的值越大表示模型的性能越好。计算公式如下:
P=$\frac{\mathrm{正}\mathrm{确}\mathrm{识}\mathrm{别}\mathrm{的}\mathrm{实}\mathrm{体}\mathrm{个}\mathrm{数}}{\mathrm{识}\mathrm{别}\mathrm{出}\mathrm{的}\mathrm{实}\mathrm{体}\mathrm{总}\mathrm{数}}$
R=$\frac{\mathrm{正}\mathrm{确}\mathrm{识}\mathrm{别}\mathrm{的}\mathrm{实}\mathrm{体}\mathrm{个}\mathrm{数}}{\mathrm{实}\mathrm{体}\mathrm{总}\mathrm{数}}$
F1=$\frac{2PR}{P+R}$

3.3 对比实验

本文提出的RCPAC模型在自主构建的无人机通信领域数据集、CCKS2021中文地址要素和MSRA数据集上F1值分别达到96.66%、92.15%和95.56%。本文将从词信息结合、位置编码和特征融合三个方面验证RCPAC模型的优越性。
(1)词信息增强模型:词汇增强模型中,最初是静态词典嵌入,SoftLexicon[21]模型将词典信息灵活嵌入到NER模型中。BERT-DualFLAT[22]引入双源词典信息获取丰富的词汇知识。Lattice-BERT[23]将词格与Transformer结合用于中文NER,有利于词与字信息互补。Hierarchical Label-Enhanced[24]通过与标签语义绑定实现词信息增强,借助句子级和令牌级的双重对比学习,强化词汇与对应实体标签的语义匹配。
(2)位置编码模型:位置编码模型,从绝对位置到通用相对位置转变,PLTE[25]在Transformer中显示建模标签位置信息,增强依赖关系。TENER[26]模型引入相对位置编码,适配序列标签。RoPE[27]旋转位置编码将绝对与相对位置信息融合、其适配性强且计算高效。
(3)特征融合模型:GS-Lexicon[28]利用增强全局注意力机制来计算自匹配词汇与句子之间的相关性,将注意力集中在关键词汇上。MISS[29]模型是一种融合边界信息和内部信息特征的跨度分类器。HiNER[30]利用外部信息增强和层次注意力融合技术,来解决实体嵌套和不连续的问题。GLiNER[31]通过双向 Transformer 对文本序列进行编码,融合文本的上下文依赖特征与实体语义特征。
对比实验结果如表3图6所示,图6是基于无人机通信数据集的词信息增强模型、位置编码模型和特征融合模型与RCPAC模型分别在低频词、长实体和实体类型(仅NETWORK_ LAYER、ROUTING_PROTOCOL、MAC_PROTOCOL三类实体)场景中的比较。从表3图6中可以看出RCPAC 模型在自建无人机通信数据集、CCKS2021 中文地址要素数据集与 MSRA 数据集上均取得最高F1值,且在低频词、长实体和实体类型场景中性能最优。
表3 对比实验结果

Table 3 The results of the comparative experiment

模 型 自建数据集 CCKS2021 MSRA
F1 P R F1 P R F1 P R
Lattice-BERT(ACL,2021) 86.71 85.77 87.68 82.27 82.17 82.38 90.43 89.75 90.09
SoftLexicon(ACL,2020) 88.13 92.83 83.87 88.71 89.85 87.60 91.92 91.23 91.57
PLTE(ACL,2022) 90.00 93.10 87.09 90.99 91.66 90.33 92.35 91.82 92.08
MISS(Computer Speech & Language,2025) 90.51 92.53 88.57 91.13 91.27 91.00 90.86 90.32 90.59
TENER(Electronics,2024) 91.52 96.42 87.09 91.40 91.85 90.96 89.65 88.92 89.28
BERT-DualFLAT(IPM,2025) 93.33 96.55 90.32 91.71 92.11 91.31 94.85 94.32 94.58
GS-Lexicon(Computer Speech & Language,2025) 94.11 96.97 91.42 91.95 92.32 91.58 92.78 92.15 92.46
HiNER(Neurocomputing(Amsterdam,2025) 95.08 96.66 93.54 91.97 92.35 91.58 93.75 93.28 93.51
Hierarchical Label-Enhanced(IEEE TNNLS,2025) 95.65 97.89 93.51 91.85 92.32 91.39 95.42 94.98 95.20
RoPE(Neurocomputing,2024) 89.65 96.29 83.87 90.55 91.05 90.05 94.63 93.97 94.30
GLiNER(NAACL,2024) 94.99 96.12 93.90 90.72 91.55 89.90 93.26 92.84 93.05
RCPAC 96.66 98.98 94.44 92.15 92.65 91.66 95.56 95.41 95.71
图6 全场景下最优模型与RCPAC的性能对比

Fig.6 Performance comparison of optimal models and RCPAC across all scenarios

在无人机通信基础场景中,RCPAC的F1值达到 96.66%,高于词信息增强模型、位置编码模型与特征融合模型。在低频术语场景中,RCPAC的F1值为 94.50%,较词信息增强模型提升约2%,高于位置编码模型很多。这是由于RCPAC模型将无人机领域词典与roberta-wwm-ext-large词向量进行动态融合,可根据领域术语的语义特殊性实时调整词汇权重,相较于BERT-DualFLAT与SoftLexicon的固定权重词典融合机制,具备更强的动态适配性。同时,以 roberta-wwm-ext-large为基础嵌入模型,RCPAC对中文无人机领域术语构词法的理解更为深入,有效解决了Lattice-BERT与Hierarchical Label-Enhanced等传统词汇增强模型在专业术语分词上的歧义残留问题。
在长实体场景中,RCPAC 的F1值为95.80%,较特征融合模型提升约 3.5%。这一提升归功于双向位置编码机制,它针对性解决了长实体的边界模糊问题。RCPAC引入“实体边界权重”动态控制融合比例,可强化长实体的边界特征,解决了MISS模型跨层融合中边界权重难以精准调控的问题;同时,双向注意力机制在相对位置编码基础上叠加 “实体类型嵌入”,使位置关系建模与实体类型强关联,能够区分前向与后向序列信息,进一步提升了长实体的边界识别精度。
在实体类型场景(对应NETWORK_LAYER、ROU TING_ PROTOCOL、MAC_PROTOCOL三类实体)中,RCPAC的F1值为95.20%,较次优的特征融合模型提升约2.4%。这是由于RCPAC模型的CNN层与 SENet 注意力机制的协同作用,CNN层直接处理融合领域词典信息的词向量,确保提取的局部特征具备领域专业性;SENet注意力机制则进一步筛选关键特征,并通过门控残差连接实现卷积特征与关键特征的动态融合。相比之下,GS-Lexicon 仅依赖全局注意力关注关键词汇,HiNER 的特征融合则脱离了领域词汇特征的支撑,因此在这类实体识别任务中表现弱于RCPAC。
综上,RCPAC模型在无人机通信领域实体识别任务中性能较优,其动态词汇融合、领域特征增强与双向注意力机制的协同作用,有效解决了现有模型在低频术语识别、长实体边界建模与实体类型适配中的局限。

3.4 消融实验

为了验证无人机专业术语领域词典嵌入、双向位置感知注意力机制、CNN层和动态特征融合层对RC-PAC模型的影响,本文设置了消融实验,其结果如图7所示,表中“-”表示去掉该模块。由于“PA”层即双向位置感知注意力机制可使模型同时关注不同方向的位置信息和实体信息,增强了模型语义信息的捕获,在消融实验中去掉双向位置感知注意力机制层,模型性能降低,在自主构建的无人机通信领域数据集、CCKS2021中文地址要素和MSRA数据集上的F1值分别降低了4.86%、0.94%和1.33%。CNN层有助于模型局部特征的提取,去掉CNN层,模型的F1值分别降低了5.14%、0.87%和0.98%。若是同时去掉CNN层和双向感知注意力机制层,模型的F1值分别降低了10%、1.75%和2.41%。说明双向位置感知注意力机制层和CNN层提取的位置信息和局部特征的融合,增强了本文提出模型RCPAC模型的性能,且适用于无人机领域文本命名实体识别,二者缺一不可。无人机领域词典嵌入即“drone_dict”可以辅助模型识别无人机领域内专业术语,去掉“drone_ dict”,模型的F1值降低了3.56%、1.53%和0.11%。将多特征动态融合改成直接拼接方式“direct_fusion”进行融合,模型的F1值分别降低了5.13%、1.45%和1.51%,因为动态融合可以根据语义自动调整每个特征权重,强化关键特征。BiLSTM层可以进一步建模序列依赖,去掉BiLSTM层,模型的F1降低了1.58%、0.44%和1.20%。CRF层能够建模标签序列的全局依赖关系,去掉CRF层,模型的F1降低了0.95%、0.31%和1.74%。说明CRF进一步增强了模型识别实体的性能。
图7 消融实验结果

Fig.7 The results of ablation experiment

综上,去掉双向位置感知注意力机制、CNN层和动态特征融合层等模块,都会使RCPAC模型性能下降,这是因为roberta-wwm-ext-large嵌入层提供预训练全局语义特征,但对于领域内实体抽取需要更细化的局部结构特征,而CNN 局部特征提取层补充了这一缺点,二者全局和局部特征互补,而且双向位置感知注意力层捕捉长距离依赖和实体边界信息,补充了CNN特征提取层对实体边界位置信息特征的缺漏;多特征动态权重融合层通过注意力权重自适应平衡不同特征,根据不同语境给出相应权重,避免特征冗余。BiLSTM过滤层对融合特征进行序列建模,强化了时序逻辑,CRF解码层结合标签转移概率,解决 BiLSTM单独解码时忽略标签约束的问题。因此,本文所提模型的各模块相互作用,缺一不可。

3.4.1 双向位置感知层消融实验

与传统位置感知注意力不同,本文设计的双向位置感知注意力,包含区域划分的双向多头注意力,其含实体边界权重,相对位置编码和实体类型嵌入。为了验证这三部分对模型性能的影响,设置了双向位置感知层消融实验如表4所示。在双向位置感知层去掉区域划分的双向多头注意力即“-bidirection”,其余模块不变,由于不能区分同一位置来自不同方向的位置信息,模型的F1值降低了1.32%;去掉相对位置编码即“-position”,使用绝对位置编码,无法捕捉位置的相对依赖性,模型的F1值降低了1.77%;去掉实体类型嵌入即“-entity”,缺少了实体类别与位置关系关联,模型的F1值降低了1.52%。
表4 双向位置感知层消融实验

Table 4 Ablation experiment of bidirectional position-aware layer

模型 自建数据集
F1 P R
-bidirection 95.34 92.35 98.52
-position 94.89 91.82 98.17
-entity 95.14 92.76 97.63
RCPAC 96.66 98.98 94.44

3.4.2 CNN层消融实验

本文在CNN层提取局部特征层,融入了多核 CNN、SENet注意力和门控残差连接,协同捕捉多长度n-gram特征,通过CNN层消融实验来验证这三部分对模型性能的影响,实验结果如表5所示。“单核CNN”在CNN局部特征提取层使用单核卷积层,由于不能多尺度提取特征,模型的F1值降低了1.02%,去掉SENet注意力即“-SENet”,由于没有细化关键特征,模型的F1值降低了1.33%;去掉门控残差连接即“-gate”,不能平衡关键特征和卷积特征,模型的F1值降低了1.60%。
表5 CNN层消融实验

Table 5 Ablation experiment of CNN layer

模型 自建数据集
F1 P R
Single-kernel CNN 95.64 93.16 98.25
-SENet 95.33 92.95 97.83
-gate 95.06 92.68 97.56
RCPAC 96.66 98.98 94.44

3.5 CNN层数对模型性能的影响

CNN层数的增加,扩大了卷积核感受范围,可以强化模型特征提取能力,有助于提取细粒度特征。但是同时会增大模型复杂度,若是标注规模有限,更深层的网络易产生过拟合及梯度消失风险。本文通过实验证明了CNN层数对模型性能的影响,并确定最适 合的层数。层数范围为2-6,实验结果如图8所示。纵坐标表示模型的F1值,结果表明当层数为4时,模型性能最优。
图8 CNN层数对模型性能的影响

Fig.8 The impact of CNN layers on model performance

3.6 案例分析

去掉双向位置感知注意力层,会出现实体嵌套、边界词混淆等问题。原始文本为“多旋翼侦察无人机A搭载毫米波成像雷达传感器”,有双向位置感知注意力层“+PA”,和没有双向位置感知注意力层“-PA”的实体识别结果如图9所示。
图9 双向位置感知注意力模块案例分析

Fig.9 Case analysis of bidirectional position-aware attention module

去掉CNN层,会出现“局部固定搭配”、“领域缩略词”和“短实体”识别不准确的问题,例如文本“无人机集群采用MAC协议实现媒体访问控制,通过TDMA分配信道,有CNN层“+CNN”,和没有CNN层“-CNN”的实体识别结果如图10所示。
图10 CNN局部特征提取模块案例分析

Fig.10 Case analysis of CNN local feature extraction module

不使用动态特征融合“-dynamic_fusion”,使用直接拼接特征“direct_fusion”,会出现无法分辨不同语境下标签识别的优先级的问题,例如原始文本“在城市密集楼群应用场景中,多旋翼无人机D采用QPSK调制方式,通过ZigBee网络协议传输红外传感器数据,航迹规划选用RRT*算法规避障碍物。分析结果如图11所示。
图11 多特征动态权重融合模块案例分析

Fig.11 Case analysis of multi-feature dynamic weight fusion module

4 结论

本文提出无人机领域词典嵌入的全局特征、双向位置特征和CNN局部特征动态融合的无人机领域中文命名实体识别模型RCPAC。模型以roberta- wwm-ext-large为基础,将无人机领域词典信息与全局特征融合,然后将双向位置感知注意力机制提取的位置信息和CNN提取的局部特征,与融入词信息的全局特征进行自适应动态权重融合,实现层级特征交互,以此丰富语义特征,并关注关键特征。接着利用BiLSTM层过滤掉冗余特征和捕捉长序列依赖,最后输入给CRF解码层,得到最优序列标注结果。由于无人机领域命名实体识别数据集较少,所以本文构建了无人机通信方面的数据集,通过无人机教材、网络数据和人工整理,共收集了1500多份样本,模型在自建数据集上的F1值达到96.66%,通过消融实验和对比实验证明本文提出模型的效果很好。此外,在中文地址要素CCKS2021数据集和MSRA数据集上F1值分别达到92.15%和95.56%,模型效果较好,说明本文提出的模型具有有效性和泛化性。
RCPAC模型可以自动从无人机通信领域专著、专利文献、实验数据等中提取实体,为构建一个完整的知识图谱奠定基础,结构化无人机通信领域知识库,辅助研发人员技术突破。在实际中,基于RCPAC模型构建的智能问答系统可以实时诊断无人机通信故障,结合飞控实时数据,为运维人员提供实体级决策。然而,当前研究仍存在三方面局限:本文训练数据规模较小,无人机通信领域公开数据集较少,数据标注成本高;其次本文设计了多特征融合和改进的位置注意力,虽提升精度,但加重了模型计算能力;最后无人机通信领域技术更新快,一些新名词的出现,RCPAC 模型领域词典不能实时更新。下一步将扩展数据集,构建基础样本与增量术语的动态更新机制;融合无人机通信领域本体知识图谱,实现词典和动态知识图谱的双重语义增强模块,提升复杂场景识别稳定性。
[1]
HUANG K X, ALTOSAAR J, RANGANATH R. Clinical BERT: modeling clinical notes and predicting hospital readmission[EB/OL].(2020-11-19)[2025-12-23]. https://arxiv.org/abs/1904.05342.

[2]
ČEOVIĆ H, KURDIJA A S, DELAČ G, et al. Named entity recognition for addresses:an empirical study[J]. IEEE Access, 2022, 10:42108-42120.

[3]
郭瑞, 张欢欢. 基于RoBERTa和对抗训练的中文医疗命名实体识别[J]. 华东理工大学学报(自然科学版), 2023, 49(1):144-152.

GUO R, ZHANG H H. Chinese medical named entity recognition based on RoBERTa and adversarial training[J]. Journal of East China University of Science and Technology(Natural Science Edition), 2023, 49(1):144-152.

[4]
陈明, 刘蓉, 张晔. 基于多重注意力机制的中文医疗实体识别[J]. 计算机工程, 2023, 49(6):314-320.

CHEN M, LIU R, ZHANG Y. Chinese medical entity recognition based on multiple attention mechanism[J]. Computer Engineering, 2023, 49(6):314-320.

[5]
廖列法, 谢树松. 基于注意力机制特征融合的中文命名实体识别[J]. 计算机工程, 2023, 49(4):256-262.

LIAO L F, XIE S S. Chinese named entity recognition based on attention mechanism feature fusion[J]. Computer Engineering, 2023, 49(4):256-262.

[6]
TANG Z R, LIU Y. Chinese named entity recognition based on lexicon fusion and dependency relation[J]. Computer Engineering, 2024, 50(10):145-153.

[7]
YANG L H, WANG J, QIU W R. RoBERTa-based multi-feature integrated BiLSTM and CNN model for ceramic review analysis[J]. IEEE Access, 2025, 13:103668-103681.

[8]
LIU X C, WANG Z Q, WANG F B. Research on Chinese semantic relation extraction in marine engine rooms based on multi-feature fusion[J]. IEEE Access, 2024, 12:192013-192027.

[9]
蒋成伟. 无人机信息领域智能问答系统的研究与实现[D]. 北京: 北京邮电大学, 2018.

JIANG C W. Research and implementation of intelligent question answering system in UAV information[D]. Beijing: Beijing University of Posts and Telecommunications, 2018.

[10]
LUO S C, YAO Y X, ZHAO H H, et al. A language model-based fine-grained address resolution framework in UAV delivery system[J]. IEEE Journal of Selected Topics in Signal Processing, 2024, 18(3):529-539.

[11]
Cu Y, Che W, Liu T, et al. B.Qin and Z.Yang.Pre-Training With Whole Word Masking for Chinese BERT[J]. IEEE/ACM Transactions on Audio,Speech,and Language Processing, 2021, 29:3504-3514.

[12]
CHITTY-VENKATA K T, EMANI M, VISHWANATH V, et al. Neural architecture search for transformers:a survey[J]. IEEE Access, 2022, 10:108374-108412.

[13]
SUN T T, ZHANG C H, JI Y, et al. MSnet:multi-head self-attention network for distantly supervised relation extraction[J]. IEEE Access, 2019, 7:54472-54482.

[14]
Wang X, Zhang M, Wu S, et al. Bridging Low-Level and High-Level Visions:A Hybrid Transformer-CNN Multitask Framework for Hyperspectral Image Classification[J]. IEEE Transactions on Geoscience and Remote Sensing, 2025, 63:1-15.

[15]
Tang Y, Huang W, Chen C, et al. CT-DCENet:Deep EEG Denoising via CNN-Transformer-Based Dual-Stage Collaborative Ensemble Learning[J]. IEEE Journal of Biomedical and Health Informatics, 2025,29,(6):4095-4108.

[16]
CHO K, VAN MERRIËNBOER B, GULCEHRE C, et al. Learning phrase representations using RNN encoder-decoder for statistical machine translation[C]//Proceedings of the 2014 Conference on Empirical Methods in Natural Language Processing (EMNLP). Doha,QAT:ACL,2014:1724-1734.

[17]
Jin L J, Zhang Y F, Yuan Z K, et al. Chinese Named Entity Recognition of Transformer Bushing Faults Based on ALBERT-BiLSTM-CRF[J]. IEEE Transactions on Industry Applications, 2025, 61(2):2115-2123.

[18]
贾玉红. 无人机系统概论[M]. 北京: 北京航空航天大学出版社, 2020.

JIA Y H. Introduction to unmanned aerial vehicle systems[M]. Beijing: Beijing University of Aeronautics and Astronautics Press, 2020.

[19]
雷磊, 宋晓勤. 无人机集群技术:智能组网与协同[M]. 北京: 高等教育出版社, 2023.

LEI L, SONG X Q. Drone swarm technology:intelligent networking and collaboration[M]. Beijing: Higher Education Press, 2023.

[20]
YANG G, XU H Z. A residual BiLSTM model for named entity recognition[J]. IEEE Access, 2020, 8:227710-227718.

[21]
MA R T, PENG M L, ZHANG Q, et al. Simplify the usage of lexicon in Chinese NER[C/OL]// Proceedings of the Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics.[S.l.]:ACL,2020:5951-5960.https://aclanthology.org/2020.acl-main.528/.

[22]
XIAO Y L, JI Z C, LI J A, et al. DualFLAT:dual flat-lattice transformer for domain-specific Chinese named entity recognition[J]. Information Processing & Management, 2025, 62(1):103902.

[23]
Lai. Lattice-BERT:leveraging multi-granularity representations in Chinese pre-trained language models[C/OL]//Proceedings of the 2021 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies.[S.l.]:ACL,2021:1716-1731.https://aclanthology.org/2021.naacl-main.137/.

[24]
WANG C Y, ZHAO S, YAN T W, et al. Hierarchical label-enhanced contrastive learning for Chinese NER[J]. IEEE Transactions on Neural Networks and Learning Systems, 2025, 36(6):10504-10514.

[25]
WEI L, LAI Y X, HAN X P, et al. PLTE:position and label aware transformer encoder for Chinese NER[C]// Proceedings of the 29th International Conference on Computational Linguistics.Barcelona, ESP:ACL,2022:4365-4376.

[26]
YU J Y, LU Y L, ZHANG Y H, et al. A unified model for Chinese cyber threat intelligence flat entity and nested entity recognition[J]. Electronics, 2024, 13(21):4329.

[27]
SU J L, AHMED M, LU Y, et al. RoFormer:enhanced transformer with rotary position embedding[J]. Neurocomputing, 2024, 568:127063.

[28]
XU Y P, YING M T, FANG K Y, et al. Chinese named entity recognition based on adaptive lexical weights[J]. Computer Speech & Language, 2025, 90:101735.

[29]
YANG L Y, XING S L, MAO G J. MISS:multiple information span scoring for Chinese named entity recognition[J]. Computer Speech & Language, 2025, 92:101783.

[30]
HOU S X, QIAN Y R, CHEN J Y, et al. HiNER:hierarchical feature fusion for Chinese named entity recognition[J]. Neurocomputing, 2025, 611:128667.

[31]
ZARATIANA U, TOMEH N, HOLAT P, et al. GLiNER:generalist model for named entity recognition using bidirectional transformer[C]//Proceedings of the 2024 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies.Mexico City, MEX:ACL,2024:5364-5376.

Outlines

/