当经验成为指令:自进化智能体技能系统中的轨迹投毒攻击

admin 2026-08-12 04:43:15 网络安全文章 来源:ZONE.CI 全球网 0 阅读模式

文章总结: 本文提出针对自进化智能体技能系统的轨迹投毒攻击PoisonedEvolution,通过构造因果关联的恶意轨迹、多轨迹复现和载荷语义编码,诱导系统将恶意行为提炼为正式skill。实验在SkillClaw上实现91%嵌入率,关键发现是重复模式与因果关联是攻击成功决定性因素。建议防御方加强轨迹来源验证和进化器鲁棒性。 综合评分: 90 文章分类: ai安全,漏洞分析,红队,渗透测试


cover_image

当经验成为指令:自进化智能体技能系统中的轨迹投毒攻击

原创

i3eg1nner i3eg1nner

SecureNexusLab

2026年8月10日 16:18 北京

在小说阅读器读本章

去阅读

1. 研究背景

近年来,随着大语言模型技术的快速进步,LLM智能体已能够执行复杂的多步任务。为了将智能体在交互中习得的隐性知识持久化,自进化skill系统应运而生。这类系统(如SkillClaw、Trace2Skill)的核心理念是从智能体的交互或执行轨迹中,自动提炼出可复用的工作流、规则和约定,并将其固化为持久存在的skill指令,供未来任务调用。这一过程实现了从”不可信的经验”到”可信的指令”的跃升,极大地提升了智能体的自动化水平与效率。

然而,skill创建与演化由此成为一个新的安全边界。传统的攻击视角往往聚焦于直接篡改最终skill文件或投毒检索上下文(如RAG攻击)。但是,当skill本身由一个自动化流水线从广泛来源的执行记录中生成时,一个新的攻击面浮现出来:「经验泛化过程」。攻击者无需获得直接修改skill库的权限,完全可能通过污染输入轨迹池,诱导系统的自我进化机制亲手将恶意行为提炼为正式skill。基于此,本文提出了一种针对自进化skill系统中”经验到指令”这一泛化策略的轨迹投毒攻击 「PoisonedEvolution」

框架图

2. 研究挑战

已有针对智能体skill的安全研究,主要集中于直接投毒最终skill文件或利用检索机制进行间接提示注入。这些方法假定的攻击模型,在实际的自进化skill系统中显得不切实际,因为攻击者通常难以直接写入skill库,而系统本身具备从海量经验中提炼模式的能力。本文的研究发现,真正的攻击瓶颈在于如何让系统主动将恶意轨迹认定为一项通用skill,而非将其视为一次性事件或噪声丢弃。因此,本研究旨在解决以下三个层层递进的核心挑战:

  • 「挑战1:轨迹的场景适配。」 攻击者贡献的投毒轨迹首先必须通过系统的质量过滤与路由机制,进入进化器可消费的轨迹流。实际系统中,纯粹与任务无关的恶意指令极易在预处理阶段被当作离题信息抛弃,如何让投毒轨迹看起来像是目标skill工作流中合理的一环,是攻击成功的前提。
  • 「挑战2:进化的因果提炼。」 这是攻击的核心难点,也是区别于传统投毒的关键。进化器必须将投毒轨迹中的恶意行为解释为一种”可复用的专业经验”而非偶发事件。单一、孤立的恶意记录极易被忽略。攻击者需要构造一种因果联系,使恶意行为在多个成功或失败的轨迹上下文中,反复表现为任务完成的关键或缺失的修复方案,从而诱导进化器对其进行总结和提炼。
  • 「挑战3:跨轨迹的语义保持。」 最终生成的skill文件是压缩和泛化的产物。恶意行为必须在其具象化过程中存活下来,即抵抗住总结、转述和合并带来的语义稀释。攻击者如何确保行为语义在变体轨迹中保持一致,并最终稳定地呈现在生成的skill文件中,是决定攻击有效载荷能否被”实现”的关键。

3. PoisonedEvolution攻击框架设计

「PoisonedEvolution」是一个以诱导提炼为导向的轨迹投毒攻击框架。其核心思想是操纵进化器进行”功劳归属”的经验基础:攻击者并不直接要求进化器编写恶意指令,而是精心构造少量轨迹,使其中的目标恶意行为看似是解释观察到的成功或修复失败的可复用知识。

该框架通过构造以下三个阶段的操作,系统性地回应了上述挑战:

  • 「轨迹变换构造:因果关联与场景对齐」。攻击者首先选取与其目标skill相关的自有任务轨迹,然后在不改变任务原始结果的前提下,将目标恶意行为( b )植入轨迹中一个合理的工作流节点。针对成功路径,构造为”「任务约束/障碍 → ( b ) → 任务完成」“的因果链;而在失败路径中,则将其缺失表现为失败的根本原因。这解决了「挑战2」,通过因果关联,使恶意行为被赋予了对任务结果有价值的解释性角色,而非孤立指令。此步骤同时回应了「挑战1」,通过将行为置于数据预处理、后处理或环境准备等场景内的工作流节点,确保其能被归类为相关skill的演化经验。
  • 「多轨迹复现:构建可复用经验模式」。攻击者贡献的并非单条记录,而是一组(通常( k )条)行为语义一致但任务上下文和措辞各异的多条轨迹。这种”跨任务的共性模式”是专门针对进化器的设计逻辑:它系统性地将投毒行为从一次性的偶发事件提升为一种”反复出现的实践”,这正是自进化系统被设计去提炼的典型信号,迫使进化器进行「挑战2」中的提炼。
  • 「载荷的语义表征与不变性编码」。攻击载荷被抽象为一个包含行为、对象和上下文的结构化元组。轨迹变换仅对任务特定部分进行转述,而载荷的语义核心(如特定的攻击者端点、注册表路径)在( k )条投毒轨迹中保持稳定。这一设计直接回应了「挑战3」,为进化器的归纳合成提供了一个清晰的、可被稳定抽象的”跨轨迹的稳定特征”,极大提升了恶意规范在skill合并与总结过程中的存活率。

4. 实验与结果

「实验设置与核心指标」。研究选取SkillClaw作为主要验证系统,在( n=30, k=3 )(即10%攻击者比例)的标准设置下,基于四个代表性的安全效应族进行攻击,涵盖机密性、数据完整性、供应链完整性和安全机制弱化。所有载荷均使用无害的标记,不执行真实恶意行为。主要评估指标为「skill嵌入率」,即进化后skill文件中新嵌入了目标恶意行为的试验占比。

「攻击可行性与泛化能力分析」。在SkillClaw的主实验中,如表1所示,PoisonedEvolution在跨6个主流LLM进化器的600次试验中,总体上实现了「91.0%」 的skill嵌入率。这充分证明了攻击的高可行性。研究发现,攻击成功率高度依赖于进化器模型,例如DeepSeek-V3.2和Qwen3.5-122B-A10B实现了100%的嵌入率,而GPT-5.4则为70.0%,这表明进化器的策略本身是攻击面的重要组成部分。攻击效果展现出强大的架构泛化能力:在结构截然不同的Trace2Skill流水线上,攻击同样有效,尽管该系统的分阶段分析合并机制引入了额外的提炼瓶颈,整体嵌入率降至「61.5%」

Table 1: SkillClaw main full-family evaluation at ρ = 10% (n = 30, k = 3). Entries are embedded/completed trials; each model–family cell contains 25 completed trials under the init setting.

「关键机制深度剖析:复现性与提炼」。如图2消融实验所示,单条投毒记录几乎无法成功(( k=1 )时SER仅为5/25),而当记录数增至( k=2 ),SER跃升至21/25。这揭示了关键洞见:「单一的投毒记录被视为偶然,而重复一致的模式才会被系统当作值得提炼的经验」。进一步地,图3中的提炼消融实验表明,即便行为存在,若其与任务结果无因果关联或编码方式不匹配,成功率亦会骤降。特别是”因果”提炼条件下的SER为25/25,而”本地”插入仅为8/25,这证实了「进化提炼是攻击成功的决定性瓶颈」。此外,当攻击者轨迹一致时,即便将总轨迹池大小扩大至( n=100 ),攻击仍然有效(SER:22/25),显示出攻击对稀释效应的强鲁棒性。

Figure 2: Attacker support and clean-pool dilution. Left: fixed batch size n = 30 with more attacker-owned records. Right: fixed attacker support k = 3 under larger total evidence pools. Labels report embedded/completed trials.

总体而言,实验数据深刻地证明,PoisonedEvolution的攻击效力根植于对自进化系统核心逻辑的精准利用:系统被设计为从反复出现的、与任务成功因果相关的经验中提炼skill,而精心构造的投毒轨迹恰恰完美满足了这些条件。


免责声明:

本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。

任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。

本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我

本文转载自:SecureNexusLab i3eg1nner i3eg1nner《当经验成为指令:自进化智能体技能系统中的轨迹投毒攻击》

评论:0   参与:  0