
一、开篇:卖铲人赢过淘金者
1849 年加州淘金热——挖到金子的人少,卖铲子和牛仔裤的人赚最多。2020s 的 AI 淘金热里,NVIDIA 就是那个卖铲人——每一波 AI 公司(OpenAI、Anthropic、Google、Meta、DeepSeek、Qwen)训练大模型都要买 NVIDIA GPU。
NVIDIA 2026 年市值 4 万亿美元,超过苹果、微软、亚马逊——这是 1999 年上市时 6 亿美元市值的 6600 倍。
GPU 怎么从游戏硬件变成 AI 算力核心?本文梳理这条变迁。
二、GPU 的诞生:游戏的副产品(1999 – 2006)
2.1 GeForce 256(1999)—— “GPU” 术语诞生
1999 年 10 月,NVIDIA 发布 GeForce 256,第一次自称 GPU(Graphics Processing Unit)——专为 3D 游戏渲染设计的并行处理器。
GPU 的核心特点:数千个小核心并行运算,专为大规模像素计算优化。这一架构特点意外契合深度学习的并行计算需求——但这一点要等 2012 年才被 Alex Krizhevsky 真正发现。
2.2 CUDA 的诞生(2007)—— GPU 变成通用计算
2007 年 NVIDIA 发布 CUDA(Compute Unified Device Architecture)——一套让程序员能用 C/C++ 直接在 GPU 上写通用计算程序的工具集。
CUDA 是 NVIDIA 最重要的战略决策:
- 短期:让游戏显卡变成科研计算工具
- 长期:让 NVIDIA 成为深度学习的标准算力
CUDA 让科研人员可以用 GPU 做蛋白质折叠模拟(Folding@home)、分子动力学、气象模拟——但深度学习还没成为主流。
2.3 早期 GPU 计算的成功案例
- 2007 – 2008:斯坦福团队用 GPU 加速神经网络训练,速度提升 10-100 倍;
- 2009:Andrew Ng 团队发现 GPU 可以把深度信念网络训练时间从几周压缩到几天;
- 2010:斯坦福、李飞飞开始用 GPU 训练 ImageNet 视觉模型。
三、AlexNet 与深度学习的 GPU 时刻(2012)
3.1 2012 年 ImageNet 竞赛
2012 年 10 月,Hinton 的学生 Alex Krizhevsky 用 2 块 NVIDIA GTX 580 GPU 训练 AlexNet——在 ImageNet 图像识别竞赛中错误率从 26% 降到 15%,震惊学术界。
关键数字:
- 1.2 million 张训练图像;
- 60 million 个参数;
- 2 块 GTX 580 GPU;
- 5 – 6 天训练时间(CPU 上需要几周)。
这是 GPU 第一次正式成为深度学习的事实标准算力。学术界意识到:未来深度学习的研究都需要 GPU。
3.2 NVIDIA 转向 AI
2012 年之后,NVIDIA 开始战略性转向 AI:
- 2013:Deep Learning SDK(基于 CUDA);
- 2014:cuDNN(深度学习原语库);
- 2016:DGX-1——首款 AI 专用工作站(8 块 P100 GPU,12.9 万美元);
- 2017:Tesla V100——专为深度学习优化的数据中心 GPU;
- 2018:TensorRT——推理优化引擎。
到 2018 年,NVIDIA 已经完成从”游戏显卡公司”到”AI 算力公司”的品牌切换。
四、大模型时代:NVIDIA 成为 AI 卖铲人(2017 – 至今)
4.1 GPT / BERT / Transformer 全面吃 GPU
2017 年 Transformer 论文发表后,大模型训练成为 GPU 黑洞:
| 模型 | 时间 | GPU 数量 | 训练成本估算 |
|---|---|---|---|
| **GPT-2** | 2019 | 数百块 V100 | 数十万美元 |
| **GPT-3** | 2020 | 1000 块 V100 | 约 1200 万美元 |
| **T5** | 2019 | 1024 块 TPU | 数百万美元 |
| **PaLM** | 2022 | 6144 块 TPU v4 | 约 2300 万美元 |
| **GPT-4** | 2023 | 25000 块 A100 | 约 1 亿美元 |
| **Llama 3** | 2024 | 16000 块 H100 | 约 6000 万美元 |
| **GPT-5** | 2025 | 50000+ 块 H100/B100 | 估计数亿美元 |
4.2 H100 / B100 / B200 系列
NVIDIA 数据中心 GPU 一代代升级:
-
- V100(2017)—— 首款 Tensor Core GPU,深度学习专用;
- A100(2020)—— 第三代 Tensor Core,训练大模型主力;
- H100(2022)—— Hopper 架构,Transformer Engine,ChatGPT 训练主力;
- B100 / B200(2024 – 2025)—— Blackwell 架构,2000 亿参数模型训练;
- GB200(2025)—— Grace Blackwell Superchip,AI 工厂核心。
4.3 NVIDIA 的护城河:CUDA 生态
NVIDIA 不只是卖硬件——它卖的是整个 CUDA 生态:
- CUDA Toolkit——程序员开发工具;
- cuDNN——深度学习原语;
- TensorRT——推理优化;
- NeMo——大模型训练框架;
- NIM——模型推理微服务;
- DGX Cloud——AI 训练云服务;
- Omniverse——3D 仿真平台。
竞争对手(AMD、Intel、中国国产 GPU)难以打破 CUDA 生态——这是 NVIDIA 的真正护城河。
五、出口管制与地缘政治(2022 – 至今)
5.1 美国对华出口管制
2022.10 拜登政府发布首次 AI 芯片出口管制——禁止向中国出口 NVIDIA A100 / H100。
NVIDIA 的应对:
- A800——中国特供版(A100 降速版);
- H800——H100 中国版;
- L40S——替代 A100;
- 2024 升级管制——A800/H800 也被禁,NVIDIA 推出降级版;
- 2025 RTX 5090 消费卡出口管制——游戏显卡也被禁。
后果:中国 AI 公司转向国产芯片(华为昇腾、寒武纪、海光)+ 走私 + 海外数据中心。
5.2 沙特、阿联酋、印度的新市场
出口管制让 NVIDIA 失去中国市场,但沙特、阿联酋、印度成为新增长极:
- 沙特 HUMAIN(与 NVIDIA 合作 100 亿美元);
- 阿联酋 G42(与 OpenAI 合作 200 亿美元);
- 印度 Reliance / Tata / Infosys 大量采购。
六、结语:算力就是 AI 的石油
回到 2026 年——NVIDIA 已经不只是 AI 卖铲人,它就是 AI 时代的石油公司:
- 算力 = AI 的核心生产资料;
- GPU = AI 时代的”油田”;
- CUDA = AI 时代的”炼油厂”;
- NVIDIA = AI 时代的”OPEC”。
GPU 革命的故事,本质上是计算范式从 CPU 串行转向 GPU 并行的故事。这个转移从游戏开始,被深度学习接棒,被大模型放大,最终定义了 21 世纪的算力地缘。