Academic article

Research on Compliant Assembly Method Based on Reinforcement Learning for Flange Test Specimens

  • HOU Junlin , 1, * ,
  • MAO Shilu 2 ,
  • WANG Fei 2 ,
  • FU Lin 2 ,
  • SUN Ruili 1 ,
  • XU Chenghui 1
Expand
  • 1 AECC Sichuan Gas Turbine Establishment, Mianyang, 621703,Sichuan, China
  • 2 College of Mechanical and Electrical Engineering, Chengdu University of Technology, Chengdu 610059,Sichuan, China

Received date: 2026-01-29

  Online published: 2026-05-09

Abstract

Manual assembly of aero-engine casings with dissimilar flanges suffers from low efficiency,poor mating accuracy and high safety risk.To overcome these problems,this paper proposes a compliant control scheme for a six-degree-of-freedom Stewart platform that learns to insert a flange test specimen via reinforcement learning.Firstly,the kinematic and dynamic models of the Stewart platform are established,and its ability to adjust posture under complex constraints is analyzed.Secondly,a data-driven compliant strategy that fuses admittance control with a reinforcement-learning algorithm is designed to realize high-precision mating and gentle insertion.Finally,a co-simulation framework combining Webots and PyCharm is built to verify the effectiveness and robustness of the proposed method under various initial misalignments and disturbances.Results show that,compared with traditional fixed parameter admittance control methods,the proposed method reduces the maximum contact force of the platform by 30.4% and improves the assembly efficiency by about 90% during the assembly process,and achieves a steady-state position error of only 7.5mm.This indicates that the proposed method significantly improves work efficiency and accuracy while ensuring assembly safety,and has good engineering promotion value.

Cite this article

HOU Junlin , MAO Shilu , WANG Fei , FU Lin , SUN Ruili , XU Chenghui . Research on Compliant Assembly Method Based on Reinforcement Learning for Flange Test Specimens[J]. Journal of Projectiles, Rockets, Missiles and Guidance, 2026 , 46(2) : 191 -200 . DOI: 10.15892/j.cnki.djzdxb.2026.02.008

0 引言

随着工业自动化和人工智能技术的飞速发展[1],自动化装配技术作为连接零部件形成最终产品的核心环节[2,3],其重要性日益凸显。特别是在航空航天、汽车、精密仪器以及能源等高技术领域,对复杂精密零部件的装配要求极高。法兰连接作为工业中一种普遍且关键的连接形式,广泛应用于管道系统、发动机部件、传动轴连接等场合。其装配质量直接影响整个系统的密封性、承载能力和运行稳定性。然而,法兰试验件的自动化装配面临着如对准精度、配合面易损性和环境不确定性等诸多挑战。
Stewart平台,又称六自由度平台,以其独特的并联结构而著称。相较于串联机器人,Stewart平台具有高承载能力、高稳定性、快速响应等显著优势。这些优势使得Stewart平台在航空航天、精密加工、微操作、医疗器械以及虚拟现实等领域得到了广泛应用[4]。例如,在飞行模拟器中,Stewart平台用于模拟飞机的姿态变化;在数控机床中,它作为高精度加工平台;在空间对接任务中,它能够提供精确的姿态调整和对接缓冲。在机器人装配领域,Stewart平台因其高精度定位能力,常被用作微装配、精密对准以及力控制操作的执行机构[5,6]。然而,尽管Stewart平台在硬件上具备执行精密柔顺装配的潜力,如何为其开发出智能、自适应的柔顺装配策略,尤其是在面对未知环境不确定性时,仍是一个值得深入探索的方向[7]
传统力控方法既阻抗控制由Hogan[8]提出,通过定义机器人末端执行器与环境之间的期望动力学关系使机器人表现出一定的质量、阻尼和刚度特性。它允许机器人在接触过程中调节自身“软硬”程度,是实现力控的主流方法之一。导纳控制[9]作为阻抗控制的一种实现形式,它以力/力矩传感器反馈的力为输入,输出期望的位置、速度或加速度指令给底层的位置控制器。这种方法在工业机器人中应用广泛,易于实现。自适应柔顺控制则针对环境参数不确定性,研究人员提出了自适应阻抗控制等方法[10-12],通过在线估计环境参数或调节控制器增益,以提高柔顺控制对环境变化的适应性[13]。例如,Chen[14]提出了一种应用于Stewart平台对接机器人的自适应阻抗控制策略,通过Lyapunov方法调整位置补偿,有效降低了对接碰撞力。
尽管传统力控方法在许多场景下取得了成功,但它们通常需要预先建立精确的环境模型,且控制器参数的整定往往依赖于经验和大量试错。在面对复杂的、非结构化的装配任务以及无法预知的摩擦、碰撞等环境交互时,这些方法的鲁棒性和泛化能力仍然有限。
近年来,以深度强化学习(Deep Reinforcement Learning,DRL)为代表的强化学习技术在机器人领域取得了突破性进展,展现出其在处理高维感知输入、实现复杂控制策略以及适应未知环境方面的强大潜力[15]。DRL算法已被成功应用于机器人抓取[16]、放置[17]、导航[18]、灵巧操作[19]等任务。这些研究表明,DRL能够使机器人通过与环境的交互学习到复杂的、具有鲁棒性的策略,而无需显式编程或精确建模。DRL已被初步探索用于解决各种装配任务,例如,销孔配合[20]。这些研究通常利用视觉和力觉信息作为状态输入,通过设计合理的奖励函数,引导机器人学习到装配所需的力控策略和路径规划。一些研究尝试将RL与传统力控方法结合,例如,通过DRL学习阻抗参数,或学习力位混合控制中的切换策略,以期结合两者的优势。
综上所述,Stewart平台提供了卓越的硬件基础,传统柔顺控制方法在理论上成熟但实践中受限,而强化学习则展现出解决复杂、不确定性任务的强大能力。因此,本研究旨在将Stewart平台的高精度操作能力与强化学习的自适应决策能力相结合,针对法兰试验件的柔顺装配问题,设计并实现一套基于强化学习算法的导纳控制框架,以期在仿真环境中验证其在降低接触力、提高装配成功率和鲁棒性方面的有效性,为未来实际工业应用奠定基础。

1 系统总体方案与建模

1.1 法兰试验件装配系统架构

图1所示,异构法兰试验件柔顺装配系统主要由全向移动平台、Stewart六自由度调姿平台、法兰试验件以及配套其余工装组成。法兰对接本质上是一类高精度的端面对齐装配任务。在本研究中,任务目标是控制Stewart平台末端携带的异构法兰试验件,在存在初始位置误差和姿态误差的情况下,柔顺地与固定端法兰端面对齐,而后通过自动紧固技术完成法兰周向的螺栓紧固。如图1所示,为了便于分析与控制策略的设计,将装配过程划分为两个主要阶段:
图1 异构法兰试验件柔顺装配系统示意图

Fig.1 Schematic diagram of the compliant assembly system for flange test specimens

1)接近与搜索阶段: Stewart平台控制法兰从初始位置向目标区域移动。由于存在视觉或标定误差,法兰端面可能会与固定端法兰表面发生非对准接触。此阶段要求控制器能快速响应接触力,避免刚性碰撞造成工件损伤。
2)端面对齐阶段: 这是装配中最关键的阶段。由于本研究中的异构法兰试验件不同于传统轴孔装配任务,没有法兰倒角进入孔口的过程。因此,控制策略需根据力反馈调整姿态,修正侧向误差,使法兰轴线与孔轴线重合。
3)配合完成阶段:当动平台法兰与固定端法兰断面的接触力,各方向位置误差均稳定在安全范围内,即可认为配合任务完成,而后通过装配系统的自动紧固技术完成法兰周向的螺栓紧固。
表1 法兰试验件调姿平台性能指标

Table1 Performance indicators of flange test specimen attitude adjustment platform

X轴方向
行程(mm)
Y轴方向
行程(mm)
Z轴方向
行程(mm)
X轴翻滚
角度(°)
Y轴俯仰
角度(°)
Z轴偏航
角度(°)
动静平台
距离(mm)
承载重量
(kg)
定位精度
(mm)
±190 ±190 ±160 ±15 ±15 ±18 795 >2000 ±0.5

1.2 Stewart平台运动学建模

Stewart平台是一种典型的六自由度(6-Degrees of Freedom,6-DoF)并联机构,其结构通常由定平台、动平台以及连接两者的六条伸缩支链组成。在法兰试验件装配系统中,该机构通过改变六个电缸的伸缩长度来控制动平台的位姿。
为了描述机构的运动状态,首先建立如下坐标系,如图2所示。
图2 Stewart平台运动学向量示意图

Fig.2 Kinematic vector diagram of the Stewart platform

定义基坐标{B}={OB,xb,yb,zb}固连于定平台几何中心,Zb轴垂直向上。动坐标系{P}={OP,xp,yp,zp}固连于动平台几何中心,Zb轴垂直于动平台平面。设定平台第i个铰点bi在基坐标系{B}下的位置矢量为bi,动平台第i个较点Pi在动坐标系{P}下的位置矢量为pi(i=1,2,…,6)。动平台相对于定平台的位姿由位置矢量t=[x,y,z]T和旋转矩阵R描述。其中t表示Op在基坐标系{B}系中的坐标,R表示从动坐标系{P}到基坐标系{B}的旋转变换。
逆运动学求解即根据期望的末端位姿(t,R)计算各支链的长度li。根据图2中的封闭矢量链原理,第i条支链的矢量li可表示为
li=t+R·pi-bi
其中R·pi是将动平台铰点矢量变换到基坐标系下的表示。第i条支链的长度Li为该矢量的模长:
Li=li2= $\sqrt{({l}_{i}{)}^{T}{l}_{i}}$
在实际控制中,如果采用欧拉角(翻滚-俯仰-偏航ψ,θ,ϕ)来描述旋转,旋转矩阵R可表示为Z-Y-X旋转序列的乘积:
R=Rz(ψ)Ry(θ)Rx(φ)
在柔顺装配任务中,不仅关注位置,同样关注速度与力的映射。设动平台在笛卡尔空间的广义速度为 $\stackrel{ ·}{X}$=[vT,ωT]T
关节空间速度为 $\stackrel{ ·}{q}$=[ ${\stackrel{ ·}{L}}_{1}$,…, ${\stackrel{ ·}{L}}_{6}$]T。通过对支链长度公式求导,可得如下映射关系:
$\dot{q}=J \dot{X}$
其中,J为6×6的雅可比矩阵。对于Stewart机构,第i行雅可比向量Ji的物理意义明确,由支链单位方向向量i及其对动平台中心的力矩臂决定:
J= $\left[\begin{array}{ll}{n}_{1}^{T}& (R{p}_{1}\times {n}_{1}{)}^{T}\\ {n}_{2}^{T}& (R{p}_{2}\times {n}_{1}{)}^{T}\\ {n}_{3}^{T}& (R{p}_{3}\times {n}_{1}{)}^{T}\\ {n}_{4}^{T}& (R{p}_{4}\times {n}_{1}{)}^{T}\\ {n}_{5}^{T}& (R{p}_{5}\times {n}_{1}{)}^{T}\\ {n}_{6}^{T}& (R{p}_{6}\times {n}_{1}{)}^{T}\end{array}\right]$
其中,ni=li/Li
该矩阵在本文的变导纳控制中起到关键作用,它不仅将末端笛卡尔空间的修正速度映射为各电缸的速度指令,同时根据虚功原理揭示了末端接触力与关节驱动力之间的传递特性。

2 基于强化学习的柔顺装配方法

2.1 导纳控制原理

鉴于Stewart平台在Webots仿真中通常运行于位置控制模式,直接进行力控制较为困难。因此,本文采用基于位置的阻抗控制,即导纳控制。导纳控制是一种广泛应用于机器人与环境交互任务的力反馈控制策略,该控制策略通过测量末端与环境的交互力,根据预设的质量-阻尼-刚度模型计算出位置修正量,从而间接实现柔顺交互。
导纳控制的核心思想是将Stewart平台末端执行器的动态特性模拟为一个二阶机械阻抗系统,如图3所示。设期望的平衡位置为Xd∈R6,实际指令位置为Xc∈R6,则位置偏差Xe=Xc-Xd与外部接触力Fext∈R6之间的动态关系满足如下微分方程,即Stewart平台在笛卡尔空间中的导纳模型:
$M_{d} \ddot{X}_{e}+B_{d} \dot{X}_{e}+K_{d} X_{e}=F_{\text {ext }}$
其中:Md=diag(m1,…,m6)为虚拟惯性矩阵,决定系统对加速度的抵抗能力;Bd=diag(b1,…,b6)为虚拟阻尼矩阵,用于耗散能量,抑制接触瞬间的震荡;Kd=diag(k1,…,k6)为虚拟刚度矩阵,决定系统抵抗弹性变形的能力;Fext为由六维力传感器测得的接触力及力矩矢量。
图3 Stewart平台导纳控制原理

Fig.3 The principle of admittance control of Stewart platform

为了在基于Webots环境的Python控制器中实现上述控制律,需对连续方程进行离散化处理。考虑到系统响应速度要求及接触力变化特点,首先可将惯性项忽略(令Md=0)以简化计算,得到一阶近似:
$B_{d} \dot{X}_{e}+K_{d} X_{e}=F_{\text {ext }}$
假设采样周期为T,采用前向欧拉法离散化,则在第k个时刻有
$\dot{X}_{e}\left(t_{k}\right) \approx \frac{X_{e, k}-X_{e, k-1}}{T}$
再代入位置误差定义Xe=Xd-Xc解出Xc,k,得到离散化的位置更新公式:
Xc,k=Xd,k+ ${B}_{d}^{-1}$(Fext,k-KdXe,k-1T
在传统的导纳控制中,参数矩阵BdKd通常是恒定值。然而,大质量的法兰试验件装配过程具有高度非线性和时变性。因此在未接触时,动平台的自由空间运动,平台需要高刚度以保证轨迹跟踪精度,而在接触过渡阶段:需要高阻尼以吸收碰撞的能量,防止反弹;最后在约束插入阶段则需要低刚度以顺应孔壁约束,避免卡阻。固定参数难以同时满足上述相互矛盾的需求。参数过硬会导致接触力过大甚至损坏工件,参数过软则会导致响应迟滞、定位精度下降。因此,本文提出引入强化学习算法,根据实时状态自适应调节BdKd,以实现变导纳控制。

2.2 强化学习环境设计

本文采用近端策略优化(Proximal Policy Optimization,PPO)算法[21]训练变导纳控制模型。
针对Stewart平台驱动的法兰柔顺装配任务,选择PPO算法主要基于以下三方面的架构优势与机理适应性:首先,针对连续动作空间的适应性。Stewart平台的阻抗参数(刚度、阻尼)调节属于典型的高维连续控制问题。相较于处理离散动作的深度Q网络类算法(Deep Q-Network,DQN),PPO基于Actor-Critic架构,能够直接在连续空间内输出高精度的阻抗参数,避免了动作离散化带来的控制精度损失,契合法兰对接微调的需求。其次,接触不确定性下的训练稳定性。法兰装配是一个典型的接触丰富类任务,接触力的非线性突变极易导致策略梯度的剧烈震荡。传统的离线策略算法,如深度确定性策略梯度(Deep Deterministic Policy Gradient,DDPG)在面对这种强非连续动态时,往往容易陷入局部极小值或产生发散。PPO算法的核心机理在于引入了裁剪目标函数:
$L^{\mathrm{CLIP}}(\theta)=\mathbb{E}_{\wedge t}\left[\min \left(r_{t}(\theta) \hat{A}_{t}, \operatorname{clip}\left(r_{t}(\theta), 1-\varepsilon, 1+\varepsilon\right) \hat{A}_{t}\right)\right]$
过限制新旧策略比率rt(θ)的变化范围ε,在策略更新时强制施加了一个信赖域。因此在装配过程中,即使机器人遇到突发的碰撞力,算法也能限制策略更新的幅度,防止因单次错误的剧烈更新导致机器人产生危险的过激动作。这种更新特性,使其在处理装配过程中的刚性碰撞和摩擦突变时,比DDPG具有更强的鲁棒性和收敛稳定性。最后,样本效率与调参的平衡。虽然PPO作为在线策略算法在理论样本效率上略低于柔性动作评价(Soft Actor-Critic,SAC)算法,但在复杂的物理仿真环境中,其对超参数的敏感度远低于其他算法,且更容易实现并行采样。这使得在缺乏精确环境模型的条件下,PPO能够更可靠地学习到通用的柔顺装配策略。
基于上述分析,本文构建了基于Webots与PyTorch的PPO联合仿真框架,图4展示了整体技术路线与数据流向,系统主要由物理仿真环境、状态感知模块、PPO决策智能体以及底层变导纳控制器四个核心部分组成。整个流程形成了一个典型的感知-决策-执行闭环。
图4 基于强化学习的变导纳控制架构图

Fig.4 A reinforcement learning-based variable admittance control framework

首先,通过Webots物理仿真引擎获取Stewart平台末端的六维力/力矩及其实际位姿数据等状态信息。状态感知模块对上述原始数据进行滤波与归一化处理,构建反映当前装配接触状态的特征向量。基于PyTorch搭建的PPO强化学习智能体接收状态信息,通过策略网络输出当前时刻最优的导纳控制参数。底层导纳控制器根据智能体输出的动态阻抗参数和接触力反馈,计算出末端执行器的位置修正量。根据式改写的变导纳控制器表达式为
Xc,k=Xd,k+ $\left[{B}_{d}\right({a}_{k}{\left)\right]}^{-1}$(Fext,k-Kd(ak)Xe,k-1)T
其中Xe,k-1=Xd,k-1-Xc,k-1为上一时刻的位姿误差,ak为下文PPO输出的动作。
位置修正量叠加至期望位姿后,经由平台逆运动学解算模块转化为六个支腿电缸的驱动指令,驱动Stewart平台完成柔顺动作。最后平台动作后会产生新的接触状态与奖励,PPO算法根据该反馈不断迭代优化策略网络,最终实现自主学习法兰试验件的柔顺装配策略。
基于上述架构,本文将具体的变导纳控制问题进一步建模为一个连续状态、连续动作的马尔可夫决策过程(Markov Decision Process,MDP),由元组<S,A,P,R,γ>定义。其中,PPO智能体接收当前观测状态输出当导纳参数调节量,与环境交互并优化策略。
状态空间S包含了智能体进行决策所需的所有信息。为了使智能体能够感知到装配任务的进展、接触力的变化以及自身的位姿,我们将状态向量S定义为以下观测量的组合:
$S_{t}=\left[\lambda_{1} e_{p}, \lambda_{2} \dot{e}_{p}, \lambda_{3} F_{\mathrm{obs}}, a_{t-1}\right]^{T}$
其中,平台位姿误差:ep=[xe,ye,ze,αe,βe,γe]T,接触力与力矩反馈:Fobs=[fx,fy,fzxyz]T为了消除传感器噪声并提高训练稳定性,对原始力数据进行了低通滤波和归一化处理。上一时刻动作,at-1=[ΔKt-1Bt-1]T引入历史动作信息有助于不仅考虑当前状态,还能感知策略的变化趋势,保证参数调节的平滑性。
考虑到Stewart平台对末端轨迹平滑度的高要求以及导纳参数调节的精细度,本文将动作空间A定义为连续型动作空间。相较于离散动作空间,连续动作能够有效避免因参数跳变引起的机械振动,更适用于精密装配场景。智能体在每个时间步t输出一个范围在[-1,1]内的连续动作向量at,代表Stewart平台末端在笛卡尔空间中各导纳参数的归一化增量。定义动作映射函数如下:
Kd(t)=Kbase☉(1+αK·aK,t)
Bd(t)=Bbase☉(1+αB·aB,t)
其中,☉表示矩阵标积。Kbase,Bbase为预设的标定参数,保证系统基本的稳定性。αK,αB为调节缩放因子(设为0.5,则表示参数可在基值的50%~150%范围内波动)。此映射机制确保了导纳参数始终为正定,满足系统稳定性的物理约束。
奖励函数设计是强化学习收敛至最优策略的核心。针对法兰试验件柔顺装配任务的要求,设计复合奖励函数rt如下:
rt=rpose+rforce+rsmooth
其中,位置奖励引导法兰试验件接近并对齐固定端法兰,采用指数形式以在误差较小时提供更大的激励:
rpos=-w1(1-exp(-κep2))
罚主要避免过大的接触力,保护工件。当接触力超过安全阈值Fsafe时,施加惩罚:
$r_{\text {force }}=\left\{\begin{array}{cc}-w_{2}\left\|F_{\text {obs }}\right\|, & \text { if }\left\|F_{\text {obs }}\right\|>F_{\text {safe }} \\0, & \text { otherwise }\end{array}\right.$
惩罚避免导纳参数剧烈震荡,减少Stewart平台自身的冲击:
rsmooth=-w3at-at-12
所提方法在实际工程应用中的可行性,本文对算法的计算复杂度进行理论分析。由于训练过程可离线进行,那么工程落地的关键在于在线推理阶段的开销。假设策略网络采用全连接神经网络,包含L层,第l层的神经元数量为nl
1)时间复杂度:单步推理的主要计算量来自于矩阵乘法,其时间复杂度可表示为 $O({\sum }_{l=1}^{L-1}{n}_{l}·{n}_{l+1})$。在本文的网络结构设置下(输入层12维,隐藏层256维,输出层6维),单次前向传播涉及的浮点运算次数(Floating Point Operations Per Second,FLOPS)在105数量级。对于现代工业控制计算机,如IPC或嵌入式GPU模块,其计算能力通常在109数量级,单步推理耗时可控制在1ms以内,远低于法兰装配场景要求的10ms控制周期,满足硬件实时控制需求。
2)空间复杂度:空间复杂度主要取决于网络参数量,表示为 $O({\sum }_{l=1}^{L-1}{n}_{l}·{n}_{l+1}+{\sum }_{l=1}^{L}{n}_{l})$。本文模型的参数存储需求仅为数百KB级别,可实现在资源受限的嵌入式控制器中的部署。

3 仿真实验与结果分析

3.1 仿真实验设计

在仿真环境中,Stewart调姿平台承载重量约25kg的T性管道(模拟法兰试验件)。坐标系定义为平台水平对接方向为X轴负方向,环境的重力方向为Z轴负方向,根据右手定则确定Y轴正方向。实际装配工况中,法兰试验件与Stewart调姿平台在世界坐标系X轴和Y轴方向均有约束,故可以将法兰试验件和Stewart调姿平台通过力传感器固定为一个整体。法兰试验件吊装放置在Stewart调姿动平台上后,水平移动将法兰试验件与固定端法兰工件对接,模拟异构试验件装配过程。
验证基于强化学习的变导纳控制策略,分别与固定参数下的导纳控制和位置控制方法进行对比,分析不同控制策略下Stewart调姿平台的性能差异。其中导纳控制下平台的初始虚拟刚度与阻尼分别为:2500N/m和500N·s/m。导纳控制和位置控制均采用手动方式下达期望位置指令,而变导纳控制方法采用直接设置期望位置。
图5 Webots中模拟对接装配场景

Fig.5 Simulating mating and assembly scenarios in Webots

Webots基础仿真步长和强化学习变导纳控制器的控制周期均为4ms。策略网络包含两个隐藏层,每层128个神经元,使用ReLU激活函数。其输出层分为两部分,一部分输出动作均值(使用tanh激活函数限制在[-1,1]范围内),另一部分输出动作标准差(使用softplus激活函数保证正值)。价值网络包含两个隐藏层,每层128个神经元,使用ReLU激活函数。输出层为一个线性单元,用于估计状态值。裁剪参数设置为0.2,梯度裁剪最大范数为0.5,每次训练迭代5次,批量大小为8。训练过程奖励情况如图6所示。
图6 训练过程中的奖励情况

Fig.6 Rewards during training

3.2 仿真结果分析

图7为纯位置控制下,Stewart平台进行试验件法兰的对接装配过程中,接触力以及位置变化情况。在初始阶段(0-4s),试验件法兰吊装放置在平台上,在Z轴方向上产生了约281N的重力,平台XZ方向位置从0m分别下降到约-0.11m和-0.16m,平台Y方向位置则无明显变化。随后平台按照设定位置向X负半轴移动,在4.8s与固定工件发生碰撞。水平方向既X方向接触力从0N迅速上升到1348N。竖直方向既Z方向接触力从0N迅速上升到最大值720N后平缓下降。
图7 位置控制下的接触力变化、位置变化

Fig.7 Variation curves of contact force and position under position control

图8 导纳控制下的接触力变化、位置变化

Fig.8 Variation curves of contact force and position under admittance control

图9为基于强化学习的变导纳控制下,Stewart平台的接触力、位置变化和空间轨迹情况。仿真开始时平台响应迅速,往设定对接位置运动,在0.25s与固定工件发生接触。水平方向既X方向接触力控制在500N附近小幅度波动,竖直方向既Z方向接触力在200N附近波动。
图9 变导纳控制下的接触力变化、位置变化

Fig.9 Variation curves of contact force and position under variable admittance control

图10对比了三种控制方法在对接过程中平台的运动轨迹,其中位置控制下的平台末端轨迹较为简单,这受益于位置控制的高效性。导纳控制下平台末端轨迹的运动轨迹平缓。变导纳控制下的位置变化相比于前者方法来说更加平缓,实际的运动轨迹更加合理。
图10 位置控制、导纳控制以及变导纳控制下的空间轨迹变化

Fig.10 Variation curves of spatial trajectory under position,admittance and variable admittance controls

为了更直观地量化比较不同控制策略的综合性能,图11统计了位置控制、固定参数导纳控制以及本文提出的变导纳控制在最大接触力、装配时间及稳态位置误差三个关键指标上的表现。如图11(a)所示,在接触力控制方面,变导纳控制策略通过在线调节阻抗参数,显著缓解了刚性碰撞。其最大接触力仅为609N,相比于传统固定导纳控制的876N降低了约30.4%,有效避免了试验件配合面的损伤。在装配效率方面,得益于强化学习对最优策略的搜索,系统减少了不必要的调整震荡,装配时间大幅缩短至0.5s,相较位置控制和传统导纳控制提升了约90%的效率。此外,图11(c)显示了动平台在X轴方向上的位置稳态误差,变导纳控制方法在完成装配后的位置误差达到了7.5mm,优于纯位置控制和导纳控制,证明了所提方法在保障柔顺性的同时,并未牺牲装配精度。
图 11 位置控制、导纳控制以及变导纳控制下的性能对比

Fig.11 Performance comparison of position control,admittance control,and variable admittance control

4 结论

本文以六自由度Stewart并联平台为研究对象,针对法兰自动化装配中接触力过大与环境不确定性挑战,提出一种基于PPO强化学习的自适应变导纳柔顺装配策略。主要研究贡献与结论如下:
1)将PPO算法与变导纳控制相结合,使系统能根据实时接触状态自适应调整导纳参数,从根本上克服了传统导纳控制高度依赖精确环境建模与人工调参的局限性,有效解决了非结构化环境下硬接触引发的碰撞风险。
2)验证了所提策略的工程实用性与性能优势。实验表明,相比传统固定参数导纳控制,本方法在面对环境误差时表现出更强的鲁棒性。不仅显著降低了装配过程中的最大接触力与稳态误差,同时大幅提升了装配效率,实现了安全性与精确性的平衡。
3)该强化学习变导纳框架为复杂环境下的高精度装配提供了新思路。面向实际工程部署,未来工作将聚焦虚实迁移与多模态感知技术,致力于推广至卫星在轨服务对接等复杂航空航天任务中,推动Stewart平台在高端制造领域的实用化。
[1]
乔忠银. 我国工业机器人技术现状与产业化发展战略[J]. 中国民商, 2023(10):203-205.

QIAO Z Y. Current status of industrial robot technology and industrialization development strategy in my country[J]. ChinaNon-Governmental, 2023(10):203-205.

[2]
DANESHMAND M, NOROOZI F, CORNEANU C, et al. Industry 4.0 and prospects of circular economy:a survey of robotic assembly and disassembly[J]. The International Journal of Advanced Manufacturing Technology, 2023, 124(9):2973-3000.

DOI

[3]
刘检华, 孙清超, 程晖, 等. 产品装配技术的研究现状、技术内涵及发展趋势[J]. 机械工程学报, 2018, 54(11):2-28.

DOI

LIU J H, SUN Q C, CHENG H, et al. The state-of-the-art,connotation and developing trends of the products assembly technology[J]. Journal of Mechanical Engineering, 2018, 54(11):2-28.

[4]
RUSSO M, ZHANG D, LIU X J, et al. A review of parallel kinematic machine tools:design,modeling,and applications[J]. International Journal of Machine Tools and Manufacture, 2024, 196:104118.

DOI

[5]
DAVLIAKOS I, PAPADOPOULOS E. Impedance model-based control for an electrohydraulic Stewart platform[J]. European Journal of Control, 2009, 15(5):560-577.

DOI

[6]
SUN D Y, XU R H, WANG J Y, et al. Parallel robotic automated docking method for realizing space segment assembly[J]. Scientific Reports, 2025, 15(1):5754.

DOI

[7]
HOGAN N. Impedance control:an approach to manipulation[C]// Proceedings of the 1984 American Control Conference.San Diego,CA, USA:IEEE, 1984:304-313.

[8]
SICILIANO B, VILLANI L. Advanced force and position control[M]// SICILIANOB, VILLANIL. RobotForce Control. Boston,MA,USA:Springer, 1999:89-112.

[9]
ABU-DAKKA F J, SAVERIANO M. Variable impedance control and learning-a review[J]. Frontiers in Robotics and AI, 2020, 7:590681.

DOI

[10]
DEHGHAN S A M, DANESH M, SHEIKHOLESLAM F. Adaptive hybrid force/position control of robot manipulators using an adaptive force estimator in the presence of parametric uncertainty[J]. Advanced Robotics, 2015, 29(4):209-233.

DOI

[11]
DU Z J, WANG W, YAN Z Y, et al. Variable admittance control based on fuzzy reinforcement learning for minimally invasive surgery manipulator[J]. Sensors, 2017, 17(4):844.

DOI

[12]
ZHANG H Y, LI L, ZHAO J B, et al. The hybrid force/position anti-disturbance control strategy for robot abrasive belt grinding of aviation blade base on fuzzy PID control[J]. The International Journal of Advanced Manufacturing Technology, 2021, 114(11):3645-3656.

DOI

[13]
CHEN Z H, ZHAN G, JIANG Z F, et al. Adaptive impedance control for docking robot via Stewart parallel mechanism[J]. ISA Transactions, 2024, 155:361-372.

DOI

[14]
陈康. 基于机器学习的机器人装配接触状态识别方法研究[D]. 杭州: 浙江工业大学, 2020.

CHEN K. Research on robot assembly contact state recognition method based on machine learning[D]. Hangzhou: Zhejiang University of Technology, 2020.

[15]
LEVINE S, PASTOR P, KRIZHEVSKY A, et al. Learning hand-eye coordination for robotic grasping with large-scale datacollection[EB/OL].(2016-08-28)[2026-01-24]. https://arxiv.org/abs/1603.02199.

[16]
ZENG A, FLORENCE P R, TOMPSON J, et al. Transporter networks:rearranging the visual world for robotic manipulation[C]// Proceedings of the 4th Conference on Robot Learning (CoRL 2020).[S.l.]:PMLR, 2021:726-747.]

[17]
ZHU Y K, MOTTAGHI R, KOLVE E, et al. Target-drivenvisual navigation in indoor scenes using deep reinforcement learning[EB/OL].(2016-09-16)[2026-01-15]. https://arxiv.org/abs/1609.05143.

[18]
OPENAI, ANDRYCHOWICZ M, BAKER B, et al. Learning dexterous in-handmanipulation[EB/OL].(2019-01-18)[2026-01-17]. https://arxiv.org/abs/1808.00177.

[19]
INOUE T, DE MAGISTRIS G, MUNAWAR A, et al. Deep reinforcement learning for high precision assemblytasks[EB/OL].(2017-09-21)[2026-01-24]. https://arxiv.org/pdf/1708.04033v2.

[20]
MARTÍN-MARTÍN R, LEE M A, GARDNER R, et al. Variable impedance control in end-effector space: an action space for reinforcement learning in contact-richtasks[EB/OL].(2019-08-02)[2026-01-24]. https://arxiv.org/pdf/1906.08880.

[21]
SCHULMAN J, WOLSKI F, DHARIWAL P, et al. Proximal policy optimizationalgorithms[EB/OL].(2017-08-28)[2026-01-24]. https://arxiv.org/abs/1707.06347.

Outlines

/