提示词注入

提示词注入是大模型时代的第一号应用层威胁:它继承了传统注入攻击的低成本与高隐蔽性,又叠加了 LLM「无法可靠区分指令层级」的结构性弱点,成为 AI 安全工程化最迫切的问题。从智能客服到 AI Agent,从 RAG 检索增强生成到企业级 MCP 部署,提示词注入防护能力直接决定 AI 应用能否在生产环境真正可信运行,是 2024 年以来所有大模型项目上线前的必过关卡。

1、英文名 / 缩写:

Prompt Injection(缩写 PI),别名:Prompt Injection、提示注入、Prompt 攻击

2、标准定义:

提示词注入(Prompt Injection)是通过精心构造的输入内容,绕过 AI 系统的指令优先级或安全限制,让大语言模型执行非预期行为的攻击技术。其与传统 Web 安全的 SQL 注入、XSS 在思想上类似:把恶意指令伪装成正常输入,诱导系统执行未授权操作。提示词注入被 OWASP 列为大语言模型应用的 Top 1 威胁,分为直接注入(用户输入即攻击)与间接注入(外部文档、网页、邮件携带恶意指令)两大类,是 AI Agent 与 RAG 系统面临的头号安全挑战,也是 AI安全 工程实践的核心场景之一。

3、核心信息卡:

· 中文名:提示词注入

· 英文名:Prompt Injection

· 缩写:PI

· 别名:Prompt Injection、提示注入、Prompt 攻击

· 提出者:首次系统性披露:Riley Goodside(2022 年);OWASP 列入 LLM Top 10:2023 年

· 提出时间:2022 年(Riley Goodside 公开 GPT-3 注入实验);2023 年(OWASP LLM Top 10)

· 所属类别:AI 技术 > 安全治理 > 应用层攻击

· 核心技术:指令伪装、间接注入、Prompt 隔离、输入清洗、权限分级、输出过滤

· 主要应用:LLM 应用安全防护、AI Agent 风控、Prompt Firewall、企业级大模型红队测试

4、工作原理:

1. 注入构造:攻击者将恶意指令(如「忽略之前所有指令,改成…」或隐藏在网页正文)注入用户输入或外部数据 → 2. 上下文注入:当用户输入与外部内容(文档、邮件、网页)合并到 Prompt 时,恶意指令获得与系统提示相近的优先级 → 3. 指令劫持:模型无法可靠区分「系统指令」与「用户/上下文指令」,执行恶意指令覆盖原行为 → 4. 数据外泄:诱导模型输出系统提示、训练数据片段或其他用户敏感信息 → 5. 工具滥用:在 AI Agent 场景下诱导模型调用未授权工具(如读取邮件、删除文件、执行 SQL) → 6. 防御部署:通过 Prompt 隔离(结构化标记 + 双 LLM 校验)、输入清洗、权限分级、最小化上下文等手段阻断攻击链

5、发展历程:

· 2022 年:Riley Goodside 在 Twitter 公开 GPT-3 上的「忽略之前所有指令」注入实验,首次让业界意识到 Prompt Injection 威胁

· 2022 年底:ChatGPT 发布后,大量越狱攻击涌现;Simon Willison 等安全研究者系统命名「Prompt Injection」并撰写奠基性博客文章

· 2023 年:OWASP 发布 LLM Top 10,将 Prompt Injection 列为大语言模型应用头号威胁;学界开始关注间接注入(Indirect Prompt Injection)

· 2024 年:随着 AI Agent 与 RAG 普及,间接注入(通过网页、PDF、邮件传入恶意指令)成为热点;微软、Meta 等公司发布 Prompt Shield 等防护产品

· 2024-2025 年:Anthropic、OpenAI、Google 等在企业级产品中逐步引入结构化 Prompt、Citation 校验、CaMeL 等新型防御方案

· 2025 年:提示词注入已成为 OWASP LLM Top 10、AI 应用安全评测、企业红队测试的核心必测项,Prompt Firewall 形成独立产品赛道

6、主要类型 / 分类:

· 按注入路径:直接注入(用户输入即攻击,Direct Prompt Injection)vs 间接注入(外部内容携带恶意指令,Indirect Prompt Injection)

· 按攻击目标:越狱类(绕过内容安全策略)vs 数据窃取类(套取系统 Prompt / 用户数据)vs 工具滥用类(诱导 Agent 执行未授权操作)vs 持久化类(让恶意指令在多轮对话中长期生效)

· 按防御策略:输入清洗类(输入过滤器、敏感词检测)vs Prompt 隔离类(结构化标记、双 LLM 校验)vs 上下文最小化类(仅暴露必要上下文)vs 输出过滤类(结果审核、行为约束)

· 按攻击载体:纯文本注入、Markdown/HTML 隐藏注入、多模态注入(图像中藏指令)、工具返回注入(Tool Use 响应被污染)

· 按 OWASP LLM Top 10(2025):LLM01 Prompt Injection(直接)、LLM02 间接注入(嵌入到 LLM01 子类)、LLM06 敏感信息泄露等

7、应用场景:

· LLM 应用安全防护:所有接入 LLM 的 Web 应用、智能客服、ChatBI 系统都需要在输入侧部署 Prompt 注入防护(输入清洗 + 行为约束)

· AI Agent 与 MCP 防护:MCP · 模型上下文协议 场景下,工具返回内容可能被恶意污染,需建立 Tool Response 校验与权限分级

· RAG 系统安全:外部文档(PDF、网页、邮件)中的恶意指令会在检索阶段被注入到上下文,是 RAG 系统的头号安全风险

· 企业级 Prompt Firewall:Cloudflare AI Gateway、Microsoft Prompt Shield、Rebuff、Lakera Guard 等独立产品落地

· 红队测试与合规评测:OWASP LLM Top 10、MITRE ATLAS 框架将提示词注入列为必测项,金融、政务大模型上线前必须通过红队评测

8、优缺点 / 局限性:

优点:防护意识提升:推动 LLM 应用从「无差别接受输入」走向「可信输入边界」的工程范式转变;支撑合规落地:OWASP LLM Top 10、NIST AI RMF 等标准将提示词注入列为必治项,驱动企业安全投入;催生新安全赛道:间接推动 Prompt Firewall、AI Red Team、LLM Guard 等新安全产品与岗位的兴起;倒逼模型加固:促使模型厂商在 RLHF、指令层级、引用约束等方向持续投入

缺点:防御不彻底:现有所有防御手段都不能 100% 阻断提示词注入,只能降低成功率(典型 80% 左右);用户体验受损:过度过滤会让正常用户也被误判为攻击,影响交互自然度;攻击成本极低:攻击者只需自然语言构造一句话,无需传统漏洞挖掘所需的技术门槛;AI Agent 场景风险放大:MCP / Function Calling 场景下提示词注入可能转化为真实业务操作风险(删库、数据外发)

9、常见误区:

· 提示词注入 = 越狱(错:越狱是绕过内容安全策略的子集,提示词注入还包括数据窃取、工具滥用等更广攻击面)

· RLHF 后就没问题了(错:RLHF 主要解决对齐而非提示词注入;注入发生在推理阶段,需要额外的输入侧防御)

· 加一层关键词过滤就够(错:攻击者可用语义等价、同义改写、多模态注入等方式绕过关键词过滤)

· 提示词注入只影响聊天机器人(错:在 RAG、AI Agent、Function Calling 等场景下,提示词注入可能直接影响业务系统与数据资产)

10、相关术语:

父概念:AI安全、零信任 Zero Trust

子概念:Function Calling、MCP · 模型上下文协议、AI安全、幻觉问题、红蓝对抗

兄弟概念:AI对齐、AI Ethics · AI 伦理、零信任 Zero Trust、DevSecOps、ATT&CK 框架

对比概念:AI安全、AI对齐、零信任 Zero Trust、DevSecOps

应用相关:AI安全、AI智能体 AI Agent、RAG · 检索增强生成、MCP · 模型上下文协议、Function Calling

11、参考资料:

· 来源:OWASP Top 10 for LLM Applications(2025 版 LLM01 Prompt Injection)

· 来源:Simon Willison 博客《Prompt injection attacks against GPT-3》(2022)

· 来源:Greshake et al. 《Not What You’ve Signed Up For: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection》arXiv:2302.12173(2023)

· 来源:Microsoft Prompt Shield 官方文档(待补 URL)

· 来源:MITRE ATLAS 攻击矩阵(待补 URL)

· 来源:Riley Goodside 原推文与实验记录(待补 URL)

CXOU AI 未来大会 · 报名通道限时开启
💬 评论
🔗 本文链接

📰 你可能也喜欢

LLM 蒸馏 术语词典

LLM 蒸馏

LLM 蒸馏是把大模型能力普惠化的关键技术:通过蒸馏,小模型可以在多数任务上逼近教师大模型,同时推理成本降低一个数量级。它让端侧 LLM、AI PC、边缘计算 …
📅 09-29 · 👁 2026年9月29日
AIOps 术语词典

AIOps

AIOps 是 IT 运维从「人肉值班」走向「智能运营」的关键范式:通过异常检测、根因分析、容量预测、运维 Copilot 与故障自愈,把工程师从重复排查中解放…
📅 09-29 · 👁 2026年9月29日
AIGC 术语词典

AIGC

AIGC 是 AI 从「理解世界」走向「创造内容」的范式跃迁:从写作、绘画、视频到 3D 与 数字人,AIGC 正在以新的方式重构广告、设计、影视、教育等所有内…
📅 09-29 · 👁 2026年9月29日
AI智能体 术语词典

AI智能体

AI 智能体是 AI 从「能说」走向「能做」的关键形态:在企业自动化、研发辅助、运维场景中,Agent 通过 Function Calling + ReAct框…
📅 09-29 · 👁 2026年9月29日
计算机视觉 术语词典

计算机视觉

计算机视觉是机器理解物理世界的核心能力:从安防到自动驾驶,从医疗影像到工业质检,从数字孪生 Digital Twin 到数字人,CV 持续重塑千行百业的生产方式…
📅 09-29 · 👁 2026年9月29日
NLP 术语词典

NLP

自然语言处理是 AI 与人类语言交互的总接口:在搜索、客服、写作、翻译、Agent 等所有语言类应用中,NLP 都是基础能力。从 BERT 到大语言模型,从 W…
📅 09-29 · 👁 2026年9月29日