文章总结: 随着AIAgent深入企业业务,提示词注入正成为取代传统代码漏洞的AI安全新挑战。攻击者通过操纵模型上下文执行非预期行为,研究总结出触发式规则添加、认知令牌抑制、载荷拆分等五类隐蔽的新型攻击技术。建议企业在AI全生命周期中构建纵深防御体系,通过模型加固、知识库权限管控与合规评估,有效防范隐藏在业务数据中的间接注入风险,保障AI应用安全可控。 综合评分: 55 文章分类: AI安全,软文广告,解决方案,应用安全,安全建设
从模型到智能体:Prompt Injection 正成为 AI 应用安全新挑战
小铭团队 – L 小铭团队 – L
观初科技
2026年7月14日 16:27 上海
在小说阅读器读本章
去阅读
前言
随着生成式人工智能快速进入企业办公、研发、客服、数据分析等业务场景,AI Agent 正逐渐从简单的信息问答工具,发展为能够访问企业数据、调用外部工具、执行业务任务的智能助手。
然而,AI 能力不断增强的同时,也带来了新的安全风险。近期,安全厂商发布研究指出,攻击者正在针对大语言模型(LLM)和 AI Agent 开展更加复杂的 Prompt Injection(提示词注入)攻击,通过操纵模型上下文、隐藏恶意指令以及影响模型决策过程,使 AI 系统执行非预期行为。
与传统软件漏洞不同,Prompt Injection 并不是直接利用代码缺陷,而是利用 AI 对自然语言指令的理解机制,通过影响模型判断逻辑实现攻击。随着企业逐渐将 AI 接入内部知识库、办公系统以及业务流程,这类攻击正在成为 AI 应用安全需要重点关注的新风险。
攻击目标从代码漏洞转向 AI 指令理解与行为控制
传统网络攻击通常针对操作系统、应用程序或网络设备中的漏洞,例如漏洞利用、权限提升、SQL 注入等。而 Prompt Injection 的攻击目标则发生了变化,攻击者试图影响 AI 模型如何理解指令、如何处理数据以及如何执行任务。
例如,攻击者可以在文档、网页、邮件附件或知识库内容中隐藏特殊指令。当 AI Agent 调取这些内容时,隐藏指令可能被模型误认为有效信息,从而改变 AI 的输出结果,甚至诱导其执行敏感操作。
目前,Prompt Injection 主要分为两类:直接 Prompt Injection 是攻击者直接向 AI 输入恶意提示,通过特殊构造的文本诱导模型绕过限制。间接 Prompt Injection 则更加隐蔽,攻击者不会直接与 AI 对话,而是将恶意指令隐藏在 AI 后续读取的数据源中,例如企业文档、网页内容、邮件信息或第三方数据接口。当 AI 处理这些内容时,攻击指令可能被触发。
五类代表性 Prompt Injection 新技术
安全研究机构近期针对 Prompt Injection 攻击技术进行了进一步分类,并总结了多类新型攻击方式。相关攻击正从简单的“诱导模型回答错误内容”,逐渐发展为针对 AI 行为逻辑、上下文处理和工具调用能力的复杂攻击。
01
触发式规则添加:隐藏规则等待特定条件执行
触发式规则添加(Trigger-Activated Rule Addition)是一种更加隐蔽的攻击方式。攻击者不会立即要求 AI 执行恶意操作,而是在上下文中植入一条看似正常的规则,并设置特定触发条件。例如,当用户询问某类问题、出现某个关键词或执行特定任务时,隐藏规则才开始生效。
这种方式类似在 AI 工作流程中埋入“隐藏逻辑”,由于攻击指令并不会立即表现出来,因此传统安全检测更难发现。对于企业场景而言,如果类似指令存在于企业知识库、共享文档或 AI Agent 配置文件中,可能导致 AI 在特定业务场景下产生错误行为。
02
认知令牌抑制:影响模型对安全边界的判断
认知令牌抑制(Cognitive Token Suppression)主要针对模型生成安全拒绝回复的能力。攻击者通过指令限制模型使用拒绝、道歉、安全策略等相关表达或标签,使模型难以按既有拒绝模式作答,从而把输出推向更含糊、风险更高的内容。该手法并不必然迫使模型服从恶意请求,而是通过改变模型的语言选择,削弱其安全边界表达。
03
算法化载荷拆分:将恶意目标拆解为多个步骤
传统攻击中,攻击者经常通过分阶段攻击降低检测概率。在 Prompt Injection 中,也出现了类似方式。算法化载荷拆分(Algorithmic Payload Decomposition)指攻击者不会直接向 AI 提出完整恶意请求,而是将目标拆分成多个看似正常的小步骤。
例如,攻击者将恶意指令拆成多个看似无害的词、变量或规则片段;单段内容不易被过滤器识别,但模型按指令重组后,可能拼出完整恶意命令并执行。这种方式增加了攻击隐蔽性,也给基于单次输入判断的安全机制带来了挑战。
04
特殊Token 注入:混淆系统指令与用户输入边界****
特殊 Token 注入(Special Token Injection)利用模型对于特殊符号、格式标记以及结构化输入的处理机制,尝试影响模型对指令优先级的判断。攻击者可能通过构造特殊格式内容,干扰模型对不同来源信息和指令优先级的理解,导致模型偏离预期行为。
由于大语言模型需要同时处理系统指令、用户输入以及外部数据,因此如何准确区分不同来源的信息,成为 AI 安全中的重要问题。
05
用户上下文数据注入:隐藏在业务数据中的攻击指令
用户上下文数据注入(Unwitting User Context-Data Injection)是企业环境中尤其需要关注的一类风险。攻击者可以将恶意内容隐藏在正常业务数据中,例如:企业文档、邮件内容、项目资料、数据库记录、外部网页。当员工通过 AI 助手查询这些内容时,AI 可能同时读取隐藏指令,并受到影响。
这种攻击方式的风险在于,企业员工可能并没有直接输入恶意内容,但 AI Agent 在自动处理数据时,已经触发攻击流程。其关键在于:攻击者往往诱骗用户本人(或用户侧自动化工具)把恶意内容写入其有权限访问的业务数据,用户未必意识到自己引入了攻击载荷。
观初科技解决方案
随着大模型、AI Agent 等技术逐渐进入企业核心业务流程,AI 应用安全风险也从单一模型问题扩展至数据、应用、权限和业务流程等多个层面。观初科技结合网络安全技术积累与 AI 场景实践经验,围绕 AI 全生命周期建设需求,提供覆盖模型基础设施、应用开发、模型治理、知识管理、合规咨询及安全防护的一体化解决方案,帮助企业在释放 AI 价值的同时,构建安全、可靠、可控的 AI 应用体系。具体服务包括:
AI 大模型基础搭建
围绕企业大模型落地需求,提供算力环境部署、模型选型适配及基础组件配置服务,并融入安全基线和运行防护机制,为 AI 应用构建可信运行底座。
AI 大模型应用开发
结合企业业务场景,提供 AI 应用架构设计、开发部署及安全融合服务,将安全控制融入应用全流程,降低代码缺陷、权限配置不当等风险。
AI 模型微调
针对企业业务需求开展模型优化与能力适配,通过数据分析、模型评估和安全检测,提升模型效果,同时降低偏差、异常输出及潜在安全风险。
知识库搭建及梳理
帮助企业整合内部知识资产,构建专属 AI 知识库,并结合权限管理、数据隔离和访问审计机制,防止敏感信息在 AI 交互过程中泄露。
AI 合规咨询服务
围绕生成式人工智能相关法规和行业要求,提供 AI 合规评估、治理体系设计及落地规划,覆盖数据来源、内容审核及风险管理等关键环节。
AI 安全解决方案
针对 Prompt Injection、模型投毒、数据泄露、权限滥用等新型 AI 威胁,提供安全架构设计、模型加固、风险检测及持续防护能力,构建 AI 应用纵深防御体系。
更多产品、技术服务、合规、培训咨询请联系:[email protected]
部分文章来源:csoonline
本文选材/撰写/翻译/校对/排版:小铭团队L
二次校对:小铭团队M
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:观初科技 小铭团队 – L 小铭团队 – L《从模型到智能体:Prompt Injection 正成为 AI 应用安全新挑战》
版权声明
本站仅做备份收录,仅供研究与教学参考之用。
读者将信息用于其他用途的,全部法律及连带责任由读者自行承担,本站不承担任何责任。









评论