
1、英文名 / 缩写:
Natural Language Processing(缩写 NLP),别名:自然语言理解、NLU、计算语言学
2、标准定义:
自然语言处理(Natural Language Processing,NLP)是人工智能与语言学交叉的核心领域,研究如何让计算机理解、生成、分析自然语言文本与语音,涵盖分词、词性标注、命名实体识别、句法分析、机器翻译、问答、摘要、情感分析、对话生成等任务。从基于规则与统计的方法,到深度学习与预训练大模型,NLP 经历了三次范式跃迁。当前以大语言模型 为代表的「预训练-微调-对齐-应用」范式,使 NLP 能力成为大模型时代的标配子能力,支撑搜索、智能客服、AI 写作、RAG · 检索增强生成 与 AI Agent 等所有语言类应用。
3、核心信息卡:
· 中文名:自然语言处理
· 英文名:Natural Language Processing
· 缩写:NLP
· 别名:自然语言理解、NLU、计算语言学
· 提出者:奠基:Alan Turing(1950 图灵测试);统计派:Jurafsky & Martin;神经网络派:Yoshua Bengio、Tomas Mikolov;预训练派:Google BERT、OpenAI GPT
· 提出时间:1950 年代(机器翻译起步);1970-2000 年代(统计 NLP);2013 年(Word2Vec);2018 年(BERT/GPT);2022 年(ChatGPT)
· 所属类别:AI 技术 > 深度学习 > 自然语言处理
· 核心技术:分词与词向量、Transformer、BERT/GPT 预训练、命名实体识别、序列标注、机器翻译、对话生成、Embeddings 表示学习
· 主要应用:智能搜索、智能客服、机器翻译、文本摘要、情感分析、AI 写作、RAG · 检索增强生成、AI Agent 与 Function Calling
4、工作原理:
1. 文本预处理:对原始文本进行分词、归一化、停用词过滤、子词切分(Tokenizer)等操作 → 2. 表示学习:通过 Word2Vec、BERT、Embeddings 等方式把文本转为稠密向量,保留上下文与语义信息 → 3. 模型编码:使用 RNN、CNN 或 Transformer 等模型对向量序列做上下文编码,提取语义特征 → 4. 任务建模:依据分类、序列标注、生成、问答等任务设计解码器或分类头,输出结构化结果 → 5. 预训练与微调:在大规模语料上预训练通用语言模型,再在下游任务上 Fine-tuning,提升数据效率与泛化性 → 6. 部署与对齐:将模型集成到 RAG · 检索增强生成、AI智能体 AI Agent 等应用,通过 RLHF / Prompt工程 控制输出风格与安全性
5、发展历程:
· 1950-1960 年代:图灵测试与机器翻译起步,NLP 作为 AI 子领域诞生
· 1970-1990 年代:基于规则与统计的方法主导,隐马尔可夫模型(HMM)、N-gram 语言模型成为主流
· 2000-2010 年代:统计学习成熟,SVM、CRF、主题模型 LDA 等广泛应用
· 2013-2014 年:Word2Vec、GloVe 开启词向量时代,神经网络进入 NLP
· 2017 年:Transformer架构 提出,全面替代 RNN 成为 NLP 主流结构
· 2018-2020 年:BERT、GPT、XLNet、T5 等预训练模型开启「预训练-微调」范式
· 2022-2025 年:ChatGPT 引爆大语言模型 时代,NLP 与大模型深度融合,RAG · 检索增强生成、Function Calling 成为 NLP 应用新范式
6、主要类型 / 分类:
· 按任务层级:底层(分词、词性、NER)→ 中层(句法、语义、情感)→ 高层(问答、摘要、对话、推理)
· 按技术范式:规则 NLP、统计 NLP、深度学习 NLP、大语言模型 NLP(LLM-based NLP)
· 按输入形态:纯文本 NLP、语音 NLP(ASR/TTS)、多模态 NLP(图、文、音)
· 按语言范围:单语 NLP、跨语言 NLP(机器翻译)、多语言 NLP(mBERT、XLM-R 等)
· 按应用形态:检索式 NLP(搜索、问答)、生成式 NLP(摘要、写作)、对话式 NLP(ChatBot、Agent)
7、应用场景:
· 智能搜索与问答:基于 Embeddings 的语义检索 + 大模型生成,支撑 RAG · 检索增强生成 与企业知识库
· 智能客服与对话系统:基于 NLP 的多轮对话、情绪识别、工单自动化(ChatGPT、企业客服机器人)
· 机器翻译与跨语言:Google Translate、DeepL、ChatGPT 翻译等跨语言沟通工具
· 文本分析与挖掘:舆情监测、情感分析、评论分析、合同抽取、命名实体识别(NER)
· AI 写作与内容生成:营销文案、新闻摘要、报告生成(属于 AIGC · 人工智能生成内容 范畴)
· AI Agent 与 Function Calling:通过 NLP 让模型理解用户意图并调用工具完成任务
8、优缺点 / 局限性:
优点:应用面极广:覆盖搜索、客服、翻译、写作、Agent 等几乎所有语言相关场景;大模型加持:预训练让 NLP 在零样本/少样本任务上能力大幅跃升;工程化成熟:Hugging Face、spaCy、LangChain 等生态完善,开发门槛持续降低;跨语言能力:多语言预训练模型让小语种 NLP 也能享受红利
缺点:歧义与上下文敏感:自然语言存在一词多义、隐喻、反讽等复杂语义,处理难度高;幻觉与事实性错误:大语言模型 可能生成表面流畅但事实错误的输出;领域迁移成本:通用 NLP 模型在医疗、法律等垂直领域需大量领域数据 Fine-tuning;数据隐私与合规:训练数据可能包含敏感信息,需配合 提示词注入、AI安全 防护
9、常见误区:
· NLP = 大语言模型(错:NLP 是学科,大语言模型 是当前 NLP 的主流实现方式之一)
· NLP 已经接近人类水平(错:在常识推理、隐喻理解、长程上下文等开放任务上仍有显著差距)
· NLP 只服务聊天机器人(错:搜索、推荐、风控、Agent 等背后都有 NLP)
· NLP 不需要知识图谱(错:在医疗、法律等强知识场景,NLP 仍需 知识图谱 与 Embeddings 配合提升质量)
10、相关术语:
父概念:深度学习 Deep Learning、人工智能 Artificial Intelligence
子概念:大语言模型 Large Language Model、Embeddings、思维链 CoT、Function Calling、Prompt工程
兄弟概念:计算机视觉 Computer Vision、语音识别 ASR、语音合成 TTS、知识图谱
对比概念:计算机视觉 Computer Vision、语音识别 ASR
应用相关:RAG · 检索增强生成、AI智能体 AI Agent、AI写作、智能客服
11、参考资料:
· 来源:Jurafsky & Martin《Speech and Language Processing》(NLP 经典教材)
· 来源:Mikolov et al. Word2Vec 论文 arXiv:1301.3781(2013)
· 来源:Devlin et al. BERT 论文 arXiv:1810.04805(2018)
· 来源:Vaswani et al. Transformer 论文 arXiv:1706.03762(2017)
· 来源:中国中文信息学会《自然语言处理发展报告》