文章总结: 该文分享发表于IEEETVT的科研成果:提出APS-POMDP与APS-MA-A3C算法,解耦状态预测与策略优化,先无扰动训练基础策略,再以PGD对抗训练GRU预测网络重构真实状态,规避端到端对抗训练的信用分配错乱与过拟合,增强多AUV目标跟踪对观测扰动的鲁棒性;基于真实海流地形的仿真表明其在对抗扰动、噪声及观测缺失下均优于现有算法,局限是未考虑动作层扰动且缺实测验证。 综合评分: 62 文章分类: AI安全,网络安全
团队科研成果分享-76
网络与安全实验室
2026年8月30日 05:00 江苏
在小说阅读器读本章
去阅读
在公众号小说中沉浸阅读
团队科研成果分享
2026.08.24-2026.08.30
标题:Adversarial Reinforcement Learning for Robust Multi-AUV Target Tracking against Observation Perturbations
期刊:IEEE Transactions on Vehicular Technology, 2026.
作者:Wangxu Qiu, Guangjie Han, Yu He, Shengchao Zhu.
分享人:河海大学——邱王煦
01
研究背景
BACKGROUND
研究背景
自主水下航行器(AUV)是海洋探索的重要平台,近年来更是以集群协同作业的模式与多智能体强化学习(MARL)广泛结合,显著增强了人类对海洋环境的干预能力。然而,在实际海洋环境中,AUV的观测易受环境噪声和传感器测量误差影响,且敌对目标可能采取水声对抗措施主动干扰感知,导致观测偏离真实值,进而使MARL策略的准确性和稳定性显著下降。现有对抗强化学习(ARL)虽通过在训练时引入扰动来提升鲁棒性,但其通常采用的端到端训练方式因奖励归因错乱引发策略训练不稳定,同时策略网络易过拟合于特定扰动模式,泛化能力有限。针对上述问题,本文提出基于对抗性预测状态的部分可观测马尔可夫决策过程(APS-POMDP)及基于对抗性预测状态的多AUV优势-注意力演员-评论家算法(APS-MA-A3C),通过将状态预测与策略优化解耦,并采用阶段训练策略,即先在无扰动下训练基础策略,再对抗训练预测网络,提升训练的稳定性并增强AUV集群对未知观测扰动的鲁棒性。
02
关键技术
TECHNOLOGY
关键技术
本文提出了一种基于状态预测的鲁棒决策框架。该框架不迫使策略网络学习根据受扰观测输出正确动作,而是将状态预测与决策解耦:先引入预测网络,通过对抗训练使其学习根据受扰观测重建真实状态,再使策略网络根据预测的状态进行决策。具体而言,本文的主要贡献如下:
1)提出基于对抗性预测状态的部分可观测马尔可夫决策过程(APS-POMDP)。APS-POMDP定义了一个依赖于观测扰动下状态预测的鲁棒决策过程,即首先从扰动观测中显式地预测状态,然后利用预测状态指导决策。它在结构上将状态预测与决策解耦,为提高AUV集群网络抵御不同形式观测扰动的鲁棒性奠定了理论基础。
2)提出基于对抗性预测状态的多AUV优势-注意力演员-评论家算法(APS-MA-A3C)。APS-MA-A3C采用阶段训练:第一阶段,在无扰动条件下训练智能体的基础策略;第二阶段,对观测施加对抗性扰动,并通过监督学习训练预测网络,使其能够根据扰动观测预测状态。在阶段训练过程中,策略优化不涉及对抗训练,状态预测训练也不依赖奖励信号,从而规避了观测扰动引发的信用分配扭曲。
3)引入真实海流和海底地形数据构建仿真环境,用于验证所提算法的目标跟踪性能。结果表明,我们的方法在不同强度、不同类型的观测扰动下,在算法有效性和鲁棒性两方面均超越了现有的鲁棒算法。
03
算法介绍
ALGORITHMS
算法介绍
(1)观测扰动建模
在部分可观测环境中,观测模型通常假设服从固定的条件概率分布\mathcal{Z}(o|s)。本文不考虑AUV自身运动对感知的影响,故将观测模型简化为\mathcal{Z}(o|s)。然而,对抗性扰动会引入分布外偏移,无法被固定分布模型所刻画。为此,本文将扰动显式地纳入观测模型:
其中o_i表示标称观测,其维度与语义与状态s_i一致,但是考虑了智能体传感器的量程和视场范围约束,代表理想无扰条件下的观测输出;\delta_i为扰动向量,其每一维对应一类独立的测量误差,由扰动映射v_i根据环境状态s_i生成,即\delta_i = v_i(s_i),该映射的具体形式对AUV完全未知;f定义了扰动施加于标称观测的方式,例如加性噪声直接叠加、角度偏差通过坐标变换引入等;{\hat{o}}_{i}为带有感知误差的实际观测。
本文假定扰动向量满足未知但有界(UBB)条件,用可行集\Delta_i表示扰动范围,即\delta_i \in \Delta_i。在此基础上,本文引入对抗训练机制,在可行集\Delta_i内搜索破坏性最强的扰动,迫使网络在最劣工况下训练,从而同时提升策略的性能下界和鲁棒性。
(2)对抗训练过程解耦分析
对抗训练常被建模为如下双层优化问题:
其中内层最小化通过构造最优对抗性扰动来最小化累计奖励,外层最大化则确保策略在包含最优扰动的训练条件下仍能稳定完成任务。对于内层最小化问题,已有研究表明可通过使扰动策略尽量偏离原始策略来实现。本文采用交叉熵L_{CE}量化扰动状态与干净状态下动作分布的差异,并利用投影梯度下降(PGD)算法更新观测扰动:
其中\beta为步长,a_i为干净状态s_i下的参考动作,\text{clip}(\cdot)将扰动约束在可行集\Delta_i内。外层最大化的常规做法是将内层求得的最优扰动观测纳入标准训练循环,迫使策略网络在最坏情况下训练。然而这种端到端的对抗训练本质是训练策略建立从受扰观测到正确动作的直接映射。这导致策略网络容易捕捉特定扰动与动作之间的浅层关联,而非学习观测中对扰动不变的核心特征,因而对未见过的扰动泛化能力有限。另外,当观测受到对抗性扰动而无法反映真实状态时,奖励难以被准确归因到相应状态下的动作,导致信用分配紊乱,从而造成策略训练不稳定。
为解决上述问题,本文进一步推导出双层优化目标的上界关系:
该不等式表明,扰动条件下AUV集群的累计奖励上界为无扰动全状态条件下最优策略的期望奖励。因此,一种可行的优化方向为:通过消除或补偿观测信号中的偏差,使受扰观测趋近真实状态,从而使实际策略性能逼近该上界。
具体而言,本文为每个AUV分配独立的门控循环单元(GRU)预测网络,利用最近L步扰动观测序列\hat{O}_i^{(t)} = (\hat{o}_i^{(t-L+1)}, \ldots, \hat{o}_i^{(t)})来推断当前真实状态。每个AUV独立训练预测网络,避免了参数共享导致的分布不匹配问题。
(3)基于对抗性预测状态的部分可观测马尔可夫决策过程(APS-POMDP)
在部分可观测且观测受扰的场景下,标准POMDP难以准确刻画问题。为此,本文提出APS-POMDP框架,具体形式化为:
其中,\mathcal{S}_i为状态空间,s_i为真实状态;\hat{\mathcal{O}}_i为对抗观测空间,\hat{o}_i为对抗观测,其生成方式为\hat{o}_i = f(o_i, \delta_i) = f(z(s_i), v_i(s_i)),其中z为标称观测函数,v_i为扰动映射;\tilde{\mathcal{S}}_i为预测状态空间,\tilde{s}_i为预测网络基于历史观测序列给出的状态估计;\mathcal{A}_i为动作空间,\mathcal{R}_i为奖励函数,\mathcal{P}为状态转移概率。
图1 APS-POMDP架构图
APS-POMDP的架构如图1所示,每个AUV维护一个定长观测队列,以先进先出方式存储最近的受扰观测\hat{o}_{i}^{\left( t \right)}。预测网络P_i通过GRU模块处理该队列,输出预测状态\tilde{s}_i^{(t)},随后Actor网络基于\tilde{s}_i^{(t)}决策动作。这一架构将状态预测与策略决策在结构上解耦,规避了端到端训练中奖励归因错乱的问题。
在APS-POMDP中,受扰观测\hat{o}_i在仿真与实际执行中的获取方式有所不同。仿真环境中,受扰观测通过\hat{o}_i = f(o_i, \delta_i) = f(z(s_i), v_i(s_i))生成。其中在训练阶段,为提高预测网络对不同黑箱扰动映射v_i(\cdot)的鲁棒性,本文在预测网络与扰动映射之间进行对抗训练,在扰动可行集\Delta_i内搜索最具破坏性的扰动,迫使AUV集群网络在最坏条件下学习,从而提升性能下界和鲁棒性。具体而言,最坏扰动\delta_i通过PGD生成,其迭代更新规则为:
其中h_i表示通过P_i递归处理前L-1步扰动观测所获得的历史隐状态。而在实际工程场景中,传感器输出的观测天然携带各类干扰,不存在标称观测o_i,\hat{o}_i由AUV i的传感器实时数据经计算与整合后直接给出。
(4)基于对抗性预测状态的多AUV优势-注意力演员-评论家算法(APS-MA-A3C)
基于APS-POMDP框架,本文提出APS-MA-A3C算法。APS-MA-A3C采用阶段训练策略确保训练稳定性和最终性能。在第一阶段,在无扰动条件下将AUV集群的基础策略训练至收敛。在第二阶段,引入最优对抗性扰动,训练预测网络以重构干净状态。
具体而言,首先构建经验回放缓冲区,用于存储AUV集群与环境交互产生的经验序列\tau,每个时间步的经验包含状态\mathbf{s}、动作\mathbf{a}、奖励r、下一状态\mathbf{s}’及扰动观测\hat{\mathbf{o}}。不同训练阶段利用序列中的不同信息子集。
在第一阶段训练基础策略:在无扰动条件下,利用经验回放池D_1中存储的干净数据元组(\mathbf{s},\mathbf{a},r,\mathbf{s}’),按照MA-A3C算法训练Critic网络与Actor网络至收敛。
在第二阶段训练预测网络:固定已收敛的Actor网络参数,对观测施加PGD生成的最优对抗性扰动,构建新的经验回放池D_2,其中每条样本包含真实状态\mathbf{s}与完整的L步受扰观测序列\hat{\mathbf{O}}。预测网络P_i采用GRU结构处理扰动观测序列,取最后时刻的隐状态h_{i}^{\left( t \right)}作为对真实状态的估计:
预测网络通过监督学习训练,以预测状态与真实状态之间的均方误差作为损失函数:
04
实验结果分析
ANALYSIS
实验结果分析
(1)仿真配置
为验证APS-MA-A3C算法的有效性,本文在基于真实海底地形与海流数据构建的三维水下仿真环境中进行实验。仿真区域的地形由GEBCO海底地形数据(东经121.6°—122.9°,北纬21.2°—22.5°)按800m×800m×800m尺度重新网格化生成,以约束AUV可达空间并影响近底航行避障。海流数据采用HYCOM南海日均数据集。12艘AUV随机部署于距目标300m至500m处,目标呈随机机动以模拟逃逸行为。训练共5000个回合,每回合600步。本文选取MA-A3C(无防御基线)、PGD-MA-A3C(标准对抗训练)、Recurrent-MA-A3C(仅加时序模块无对抗训练)、Ro-MA-A3C(对抗训练+时序分析+一致性正则)、KF-MA-A3C和PF-MA-A3C(基于卡尔曼/粒子滤波的状态校正算法)以及APS-MA-A3C¹(无时序模块的消融版本)作为对比基线,主要从收敛性能、鲁棒追踪性能两个方面进行评估。
(2)收敛性能分析
图2 APS-POMDP架构图
图2展示了各算法在训练过程中的累计奖励收敛曲线。MA-A3C在无扰动环境下累计奖励快速收敛且波动极小,作为性能上界参考。PGD-MA-A3C在训练初期出现显著策略振荡——端到端对抗训练中奖励基于真实状态但策略输入为扰动观测,”动作-观测-奖励”的因果链条被破坏,信用分配混乱,导致训练不稳;经过充分训练后,其策略学会根据扰动观测采取相对合理的动作,后期逐渐收敛。Ro-MA-A3C在PGD-MA-A3C基础上引入了GRU时序模块和动作一致性正则项,收敛速度和最终性能均优于PGD-MA-A3C,但初期不稳定性仍未完全消除。相比之下,APS-MA-A3C和APS-MA-A3C¹采用阶段训练策略,基础策略已在干净数据上收敛,第二阶段仅以监督学习训练预测网络,全程保持稳定上升,收敛后累计奖励接近MA-A3C无扰动上界。
图3 APS-POMDP架构图
图3为预测网络的平均损失曲线(纵轴取对数变换)。APS-MA-A3C和APS-MA-A3C¹的预测精度均快速提升并稳定收敛,而APS-MA-A3C的最终预测误差低于APS-MA-A3C¹,验证了GRU时序建模在利用历史信息还原真实状态方面的必要性。
(3)鲁棒追踪性能分析
图4 各算法分别在对抗性扰动、高斯噪声、观测缺失下的目标追踪性能
图4采用累计奖励衡量各算法在不同类型、不同强度观测扰动下的跟踪性能。在对抗性扰动下,MA-A3C性能随扰动强度增大而急剧下降。Recurrent-MA-A3C借助GRU时序信息使相邻观测之间能够相互印证,平滑了扰动对观测的影响,性能优于MA-A3C,但效果不及专用鲁棒算法。PGD-MA-A3C通过对抗训练提升了高扰动下的鲁棒性,但基础性能显著退化。Ro-MA-A3C通过引入动作一致性正则约束,缓解了基础性能损失。基于状态校正的KF-MA-A3C和PF-MA-A3C依赖预设噪声模型,在对抗性结构化攻击下矫正质量下降明显。而本文算法APS-MA-A3C在所有扰动强度下均保持最优或接近最优性能,且在无扰动时保持了较好的基础性能。在高斯噪声下,各算法性能下降均较为平缓。在观测缺失下,不具备时序建模能力的算法(MA-A3C、PGD-MA-A3C)性能随丢弃率增加急剧下降,而含GRU模块的算法及KF/PF等具时序融合能力的算法退化明显缓和。观测缺失叠加其他扰动(尤其是对抗性扰动)时,性能出现断崖式恶化。APS-MA-A3C在高缺失率及复合扰动下仍保持较优性能,受益于预测网络的对抗训练覆盖了观测不确定域内的各类情况,即便采用零阶保持补全观测,只要落在训练覆盖范围内,预测网络仍能给出不劣于训练时最差扰动下的状态估计。在极端情况下,长时间连续观测缺失可能导致零阶保持补全的观测超出训练时的观测不确定域,但从结果看其并未导致追踪算法的崩溃。
图5 追踪过程中AUV与目标的距离变化
图5展示了各算法在对抗性扰动下的AUV-目标跟踪距离曲线。中心曲线表示多轮追踪的平均距离变化;阴影区域表示距离波动,反映轨迹稳定性。其中,图5(a)-(c)对应强对抗性扰动场景(角度最大偏差30°,距离最大偏差30%)。此时,APS-MA-A3C的中心曲线收敛最快、收敛后距离平稳、阴影区域最窄,表明其在跟踪效率和轨迹稳定性上均显著优于其他基线。图5(d)-(f)对应无扰动场景,APS-MA-A3C的距离曲线与MA-A3C基本一致,表明其在无扰动时也有较好的基础性能。
图6 对抗性扰动下的AUV集群目标跟踪轨迹图
图6将3个AUV在对抗性观测扰动(角度最大偏差30°,距离最大偏差30%)下追踪一个目标的轨迹可视化,其中红色小球表示AUV,绿色小球表示目标;红色曲线为AUV的轨迹,绿色曲线为目标的轨迹。图6(a)和图6(b)分别为AUV集群采用APS-MA-A3C算法进行追踪的轨迹的俯视图和斜视图;图6(c)和图6(d)则分别为AUV集群采用MA-A3C算法进行追踪的轨迹的俯视图和斜视图。
05
总结
CONCLUSION
总结
本文研究了如何在非理想观测条件下增强AUV集群网络执行目标跟踪任务时的鲁棒性。首先,我们提出了APS-POMDP框架。通过引入鲁棒的观测建模和状态预测机制,为MARL抵御对抗性观测扰动奠定了理论基础。随后,针对传统ARL算法中常见的训练不稳定和过拟合问题,我们提出了APS-MA-A3C算法。该算法将状态预测与策略优化解耦:首先在无扰动条件下稳定训练策略至收敛;然后对预测网络进行对抗性训练,以增强其在最坏情况下的应对能力。这一设计既提高了训练稳定性,也缓解了对特定扰动模式的过拟合问题。最后,我们在三维水下目标跟踪场景中进行了仿真实验。结果表明,我们的方法在算法有效性以及对不同强度对抗性扰动的鲁棒性方面均超越了现有的鲁棒算法。本文的局限性在于主要考虑了观测层面的对抗性扰动,未纳入动作层面的扰动因素,例如对抗性水动力扰动。此外,实验验证仅限于仿真环境,算法性能尚未在实际水下环境中进行测试。未来可能的研究方向包括增强智能体对更广泛扰动因素的鲁棒性,以及构建更真实的测试环境。
END
扫描二维码关注我们
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:网络与安全实验室 《团队科研成果分享-76》
版权声明
本站仅做备份收录,仅供研究与教学参考之用。
读者将信息用于其他用途的,全部法律及连带责任由读者自行承担,本站不承担任何责任。









评论