
2024 年全球 AI 芯片市场出现一个戏剧性变化:NVIDIA 股价从 2023 年初的 150 美元涨到 2024 年 6 月的 1200 美元,市值突破 3 万亿美元,超越苹果成为全球第二大公司。这一年的 AI 算力市场被 NVIDIA 一家垄断。
但这不是故事的结尾。Google、AMD、Intel、亚马逊、华为、寒武纪等公司都在向 NVIDIA 发起挑战。这场战争的源头,要从一段 TPU 的研究历程说起。
一、Google TPU 的秘密研发(2006-2016)
Google 在 2006 年就开始秘密研发 AI 专用芯片(TPU,Tensor Processing Unit),目标是解决一个内部痛点:Google 语音识别模型的训练时间从几天缩短到几小时。
第一代 TPU(2016 年公开):2016 年 Google 首次公开 TPU v1,性能是同期 CPU/能耗的 30 倍。Google 内部已经在用 TPU 跑搜索、语音识别、翻译等核心业务。
TPU v2/v3(2017-2018):加入训练能力,开始对外部客户(通过 Google Cloud)提供。Google 的 AlphaGo 用 TPU 训练击败李世石。
TPU v4(2021):发布于 Google I/O 2021,是 TPU 历史上最大跃迁。TPU v4 Pod(4096 块)成为 H200 第一大竞争对手。
Trillium TPU v6(2024 年 5 月):Google 在 2024 年 Google I/O 发布的第六代 TPU,单芯片性能比 v5e 提升 4.7 倍。Google Cloud 提供 Trillium 实例。
TPU 的核心优势是专用化——只为 TensorFlow / JAX 设计,能效比是通用 GPU 的 2-3 倍。Google 用 TPU 训练自家大模型(Gemini、PaLM),所有外部客户通过 Google Cloud 租用。
二、NVIDIA GPU 帝国的崛起(1999-2024)
NVIDIA 起家于 1999 年发明的 GPU——Graphics Processing Unit,原本为游戏渲染设计。但 NVIDIA 的转折点在两个关键洞察:
洞察一:CUDA(2007 年)。NVIDIA 在 2007 年发布 CUDA,让 GPU 从”专用图形芯片”变成”通用并行计算平台”。这一决策在 2007-2012 年间看起来是亏本买卖(没人用),但为 2012 年后的深度学习革命埋下伏笔。
洞察二:深度学习红利(2012-2024)。2012 年 AlexNet 用 NVIDIA GPU 训练赢得 ImageNet 比赛,从此深度学习圈开始用 NVIDIA GPU。2016 年 AlphaGo 击败李世石,2017 年 Transformer 论文诞生——所有这一切的算力都来自 NVIDIA GPU。
A100(2020 年):专为 AI 训练设计,发布于 2020 年。这块芯片定义了”AI 芯片”标准——FP16 算力 312 TFLOPS、HBM2e 内存、NVLink 互联。
H100(2022 年):基于 Hopper 架构,FP16 算力 1979 TFLOPS(约 A100 的 6 倍)。H100 成为 2023-2024 年所有大模型训练的事实标准——OpenAI GPT-4、Anthropic Claude、Google Gemini、Meta Llama 3、阿里通义千问、百度文心一言,全都基于 H100 集群训练。
H200(2024 年):H100 升级,主要增加 HBM3e 内存容量(141GB),更适合推理。
B100/B200(Blackwell,2024 年发布、2025 年交付):基于 Blackwell 架构,FP4 算力达到 7 PFLOPS。单卡性能比 H100 高 5-30 倍——这是 NVIDIA 试图再次拉开与追赶者的距离。
三、追赶者的 5 大势力
2024 年 AI 芯片赛道有 5 大追赶者:
AMD:MI300X(2023 年底发布)— 192GB HBM3、1530 TFLOPS FP16。在 H100 缺货期间抢到一部分 Meta、微软、Oracle 的订单。但市场份额仍 < 10%。
Intel:Gaudi 3(2024 年 4 月)— 性能接近 H100,价格更低。但 Intel 在 AI 训练市场存在感一直很弱。
亚马逊 AWS:Trainium 2(2024 年)— 专为训练设计,AWS 自用 + 部分客户。Anthropic Claude 训练就大量用 Trainium。
华为昇腾:Ascend 910B(2024 年)— 受美国制裁影响,华为是中国唯一全栈 AI 芯片公司(昇腾芯片 + MindSpore 框架 + 盘古大模型)。昇腾 910B 在中国市场占有率超过 40%。
寒武纪 / 燧原 / 摩尔线程 / 沐曦(中国初创):分别从训练芯片、推理芯片、GPU 全栈等不同角度切入。中国市场在 2024 年呈现”百团大战”格局。
四、特斯拉 Dojo:自研芯片的另一条路
2021 年 8 月,特斯拉在 AI Day 上发布自研 AI 训练芯片 Dojo。马斯克的理由:NVIDIA 太贵、太稀缺、节奏跟不上特斯拉自动驾驶需求。
D1 芯片(2021 年发布):7nm 工艺,362 TFLOPS FP16 算力。1000 块 D1 组成的 Dojo ExaPod 算力达到 1.1 EFLOPs(全球前五)。
Dojo 在特斯拉的作用:主要用于训练 FSD(自动驾驶)和 Optimus(人形机器人)的神经网络。特斯拉是除 Google 外,唯一自己设计 AI 芯片的大型科技公司。
2024 年 8 月,马斯克宣布 Dojo 2 项目,目标是超越 NVIDIA H100 集群。
五、芯片战争的 3 大变量
变量一:美国出口管制。2022 年 10 月起,美国商务部禁止 NVIDIA 向中国出口 A100、H100 等高端 AI 芯片。这直接催生了中国 AI 芯片的爆发——华为昇腾、寒武纪、海光信息等中国厂商 2024 年营收增长 200%+。
变量二:开源芯片 RISC-V。RISC-V 是开源 CPU 架构,2024 年开始向 AI 芯片渗透。中国多家公司基于 RISC-V 设计 AI 训练芯片,试图绕开 x86 和 ARM 的授权费。
变量三:chiplet 与 3D 封装。Chiplet(芯片拼装)技术让小公司也能组合出大芯片——AMD MI300、Apple M2 Ultra 都是 chiplet 设计的代表。这一技术降低了 AI 芯片设计门槛。
六、未来 5 年格局预测
2024-2026:NVIDIA 仍占 70%+ 训练市场,但中国市场被华为昇腾占据 40%+。
2026-2028:AMD MI400 系列 + Intel Gaudi 4 + 谷歌 Trillium 第二代——追赶者缩小到 NVIDIA 性能的 50-80%。
2028-2030:中国自研芯片突破 7nm / 5nm,中国 AI 算力自主率超过 70%。
七、一句话总结
AI 芯片 10 年战争,本质是”通用 GPU vs 专用 ASIC”的范式之争——NVIDIA 用生态护城河赢了上半场,但 Google TPU / 华为昇腾 / 特斯拉 Dojo 正在不同维度上发起反击。