
1、英文名 / 缩写:
Prompt Injection(缩写 PI),别名:Prompt Injection、提示注入、Prompt 攻击
2、标准定义:
提示词注入(Prompt Injection)是通过精心构造的输入内容,绕过 AI 系统的指令优先级或安全限制,让大语言模型执行非预期行为的攻击技术。其与传统 Web 安全的 SQL 注入、XSS 在思想上类似:把恶意指令伪装成正常输入,诱导系统执行未授权操作。提示词注入被 OWASP 列为大语言模型应用的 Top 1 威胁,分为直接注入(用户输入即攻击)与间接注入(外部文档、网页、邮件携带恶意指令)两大类,是 AI Agent 与 RAG 系统面临的头号安全挑战,也是 AI安全 工程实践的核心场景之一。
3、核心信息卡:
· 中文名:提示词注入
· 英文名:Prompt Injection
· 缩写:PI
· 别名:Prompt Injection、提示注入、Prompt 攻击
· 提出者:首次系统性披露:Riley Goodside(2022 年);OWASP 列入 LLM Top 10:2023 年
· 提出时间:2022 年(Riley Goodside 公开 GPT-3 注入实验);2023 年(OWASP LLM Top 10)
· 所属类别:AI 技术 > 安全治理 > 应用层攻击
· 核心技术:指令伪装、间接注入、Prompt 隔离、输入清洗、权限分级、输出过滤
· 主要应用:LLM 应用安全防护、AI Agent 风控、Prompt Firewall、企业级大模型红队测试
4、工作原理:
1. 注入构造:攻击者将恶意指令(如「忽略之前所有指令,改成…」或隐藏在网页正文)注入用户输入或外部数据 → 2. 上下文注入:当用户输入与外部内容(文档、邮件、网页)合并到 Prompt 时,恶意指令获得与系统提示相近的优先级 → 3. 指令劫持:模型无法可靠区分「系统指令」与「用户/上下文指令」,执行恶意指令覆盖原行为 → 4. 数据外泄:诱导模型输出系统提示、训练数据片段或其他用户敏感信息 → 5. 工具滥用:在 AI Agent 场景下诱导模型调用未授权工具(如读取邮件、删除文件、执行 SQL) → 6. 防御部署:通过 Prompt 隔离(结构化标记 + 双 LLM 校验)、输入清洗、权限分级、最小化上下文等手段阻断攻击链
5、发展历程:
· 2022 年:Riley Goodside 在 Twitter 公开 GPT-3 上的「忽略之前所有指令」注入实验,首次让业界意识到 Prompt Injection 威胁
· 2022 年底:ChatGPT 发布后,大量越狱攻击涌现;Simon Willison 等安全研究者系统命名「Prompt Injection」并撰写奠基性博客文章
· 2023 年:OWASP 发布 LLM Top 10,将 Prompt Injection 列为大语言模型应用头号威胁;学界开始关注间接注入(Indirect Prompt Injection)
· 2024 年:随着 AI Agent 与 RAG 普及,间接注入(通过网页、PDF、邮件传入恶意指令)成为热点;微软、Meta 等公司发布 Prompt Shield 等防护产品
· 2024-2025 年:Anthropic、OpenAI、Google 等在企业级产品中逐步引入结构化 Prompt、Citation 校验、CaMeL 等新型防御方案
· 2025 年:提示词注入已成为 OWASP LLM Top 10、AI 应用安全评测、企业红队测试的核心必测项,Prompt Firewall 形成独立产品赛道
6、主要类型 / 分类:
· 按注入路径:直接注入(用户输入即攻击,Direct Prompt Injection)vs 间接注入(外部内容携带恶意指令,Indirect Prompt Injection)
· 按攻击目标:越狱类(绕过内容安全策略)vs 数据窃取类(套取系统 Prompt / 用户数据)vs 工具滥用类(诱导 Agent 执行未授权操作)vs 持久化类(让恶意指令在多轮对话中长期生效)
· 按防御策略:输入清洗类(输入过滤器、敏感词检测)vs Prompt 隔离类(结构化标记、双 LLM 校验)vs 上下文最小化类(仅暴露必要上下文)vs 输出过滤类(结果审核、行为约束)
· 按攻击载体:纯文本注入、Markdown/HTML 隐藏注入、多模态注入(图像中藏指令)、工具返回注入(Tool Use 响应被污染)
· 按 OWASP LLM Top 10(2025):LLM01 Prompt Injection(直接)、LLM02 间接注入(嵌入到 LLM01 子类)、LLM06 敏感信息泄露等
7、应用场景:
· LLM 应用安全防护:所有接入 LLM 的 Web 应用、智能客服、ChatBI 系统都需要在输入侧部署 Prompt 注入防护(输入清洗 + 行为约束)
· AI Agent 与 MCP 防护:MCP · 模型上下文协议 场景下,工具返回内容可能被恶意污染,需建立 Tool Response 校验与权限分级
· RAG 系统安全:外部文档(PDF、网页、邮件)中的恶意指令会在检索阶段被注入到上下文,是 RAG 系统的头号安全风险
· 企业级 Prompt Firewall:Cloudflare AI Gateway、Microsoft Prompt Shield、Rebuff、Lakera Guard 等独立产品落地
· 红队测试与合规评测:OWASP LLM Top 10、MITRE ATLAS 框架将提示词注入列为必测项,金融、政务大模型上线前必须通过红队评测
8、优缺点 / 局限性:
优点:防护意识提升:推动 LLM 应用从「无差别接受输入」走向「可信输入边界」的工程范式转变;支撑合规落地:OWASP LLM Top 10、NIST AI RMF 等标准将提示词注入列为必治项,驱动企业安全投入;催生新安全赛道:间接推动 Prompt Firewall、AI Red Team、LLM Guard 等新安全产品与岗位的兴起;倒逼模型加固:促使模型厂商在 RLHF、指令层级、引用约束等方向持续投入
缺点:防御不彻底:现有所有防御手段都不能 100% 阻断提示词注入,只能降低成功率(典型 80% 左右);用户体验受损:过度过滤会让正常用户也被误判为攻击,影响交互自然度;攻击成本极低:攻击者只需自然语言构造一句话,无需传统漏洞挖掘所需的技术门槛;AI Agent 场景风险放大:MCP / Function Calling 场景下提示词注入可能转化为真实业务操作风险(删库、数据外发)
9、常见误区:
· 提示词注入 = 越狱(错:越狱是绕过内容安全策略的子集,提示词注入还包括数据窃取、工具滥用等更广攻击面)
· RLHF 后就没问题了(错:RLHF 主要解决对齐而非提示词注入;注入发生在推理阶段,需要额外的输入侧防御)
· 加一层关键词过滤就够(错:攻击者可用语义等价、同义改写、多模态注入等方式绕过关键词过滤)
· 提示词注入只影响聊天机器人(错:在 RAG、AI Agent、Function Calling 等场景下,提示词注入可能直接影响业务系统与数据资产)
10、相关术语:
父概念:AI安全、零信任 Zero Trust
子概念:Function Calling、MCP · 模型上下文协议、AI安全、幻觉问题、红蓝对抗
兄弟概念:AI对齐、AI Ethics · AI 伦理、零信任 Zero Trust、DevSecOps、ATT&CK 框架
对比概念:AI安全、AI对齐、零信任 Zero Trust、DevSecOps
应用相关:AI安全、AI智能体 AI Agent、RAG · 检索增强生成、MCP · 模型上下文协议、Function Calling
11、参考资料:
· 来源:OWASP Top 10 for LLM Applications(2025 版 LLM01 Prompt Injection)
· 来源:Simon Willison 博客《Prompt injection attacks against GPT-3》(2022)
· 来源:Greshake et al. 《Not What You’ve Signed Up For: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection》arXiv:2302.12173(2023)
· 来源:Microsoft Prompt Shield 官方文档(待补 URL)
· 来源:MITRE ATLAS 攻击矩阵(待补 URL)
· 来源:Riley Goodside 原推文与实验记录(待补 URL)