开源大模型5年:从Llama到DeepSeek

开源大模型 5 年的故事,是一场反叛大公司闭源霸权的革命。2020 年 GPT-3 闭源让"AI 集中化"看似不可避免——但 2023 年 Meta 发布 LLaMA 开源、2024 年 Mistral / Qwen / DeepSeek / GLM 跟进,到 2025 年 DeepSeek 引发美股地震,开源大模型已成为 AI 行业不可忽视的力量。本文梳理开源大模型 5 年的故事,理解这场"AI 民主化运动"。

一、开篇:AI 是开源还是闭源?

2026 年的 AI 时代,开源 vs 闭源是核心议题之一:

  • 闭源派(OpenAI、Anthropic、Google)—— 安全可控、性能领先;
  • 开源派(Meta、Mistral、DeepSeek、阿里、智谱)—— 透明可控、生态强大。

开源大模型 5 年的故事,从 2023 年 Meta 发布 LLaMA 开始,到 2025 年 DeepSeek 引发美股暴跌达到高潮。本文梳理这场革命。

二、开源 vs 闭源:早期争论(2010s – 2022)

2.1 深度学习开源传统

深度学习本身建立在开源之上:

  • TensorFlow(Google 2015 开源);
  • PyTorch(Meta 2016 开源);
  • Hugging Face Transformers(2018 开源)。

早期 AI 研究是高度开放的——论文 + 代码 + 数据集全部公开。

2.2 GPT-2 的”开源争议”(2019)

2019 年 OpenAI 发布 GPT-2(15 亿参数),最初因为”太危险”暂不开源:

    • 引发”AI 是否应当开源”大讨论;
    • 2019 年 11 月全量开源;
    • OpenAI 在 2019 年仍然认为”AI 应该开放”。

2.3 GPT-3 闭源(2020)

GPT-3 改变了 OpenAI 的态度:

  • 1750 亿参数;
  • 2020 年发布时只通过 API 提供,不开源;
  • 标志 AI 行业从”开源”转向”API 商业化”。

GPT-3 之后:

    • OpenAI 不再开源任何后续模型;
    • Anthropic、Google 也闭源;
    • AI 行业进入”封闭 API”时代。

2.4 EleutherAI 和开源反抗(2020 – 2022)

  • 2020.7 EleutherAI 启动——一群 AI 研究员决定”复制 GPT-3″;
  • 2020.12 GPT-J(60 亿参数)发布;
  • 2021.6 GPT-NeoX(200 亿参数)发布;
  • 2021 The Pile 数据集发布(825 GB)。

EleutherAI 是开源大模型的火种——证明了”开源社区可以复现闭源大模型”。

三、LLaMA 引爆开源时代(2023)

3.1 LLaMA-1(2023.2)

Meta 发布 LLaMA-1——开源大模型的转折点:

    • 65B / 33B / 13B / 7B 四种规格;
    • 仅限学术研究使用(非商业);
    • 训练数据 1.4 万亿 token;
    • 在多项基准测试上超越 GPT-3。

3.2 LLaMA”泄露”事件(2023.3)

LLaMA-1 在 2023 年 3 月通过 BitTorrent 泄露:

    • 几周内被下载数十万次;
    • 全世界的开发者开始基于 LLaMA 微调;
    • Meta 的”限制使用”条款形同虚设——开源精神战胜了商业限制。

3.3 LLaMA-2(2023.7)

Meta 顺势发布 LLaMA-2——完全开源可商用:

  • 70B / 13B / 7B 三种规格;
  • 允许商业使用——直接和 GPT-3.5 / GPT-4 竞争;
  • 训练数据 2 万亿 token;
  • 与微软合作分发到 Azure。

LLaMA-2 的意义:证明开源大模型可以在性能上逼近闭源模型——闭源不再是不可逾越的护城河。

3.4 LLaMA-3(2024.4)

Meta 发布 LLaMA-3:

    • 8B / 70B / 400B(最大)三档;
    • 405B 版本在多项基准上接近 GPT-4;
    • 训练数据 15 万亿 token;
    • 原生多模态支持(图像 + 文本)。

3.5 LLaMA-3.1(2024.7)

    • 405B 模型开源;
    • 128K token 上下文;
    • 多语言支持(8 种语言);
    • Meta 把 LLaMA-3.1 定位为”开源 GPT-4″。

3.6 LLaMA-3.3(2024.12)

  • 70B 模型性能逼近 405B;
  • 进一步优化推理能力。

Meta 的开源 LLaMA 系列=开源大模型的最强阵容——直接挑战 OpenAI 闭源霸权。

四、Mistral:欧洲开源力量(2023 – 至今)

4.1 Mistral AI 创立(2023.4)

Mistral AI 由前 Google / Meta AI 工程师在巴黎创立:

    • 创始人:Arthur Mensch(DeepMind 前研究员)+ Guillaume Lample + Timothee Lacroix;
    • 定位:欧洲版 OpenAI,开源为主;
    • 融资:6 个月估值从 0 到 20 亿美元(创纪录)。

4.2 开源产品

模型 时间 特点
Mistral 7B 2023.9 首个开源大模型,性能超 LLaMA-2 13B
Mixtral 8x7B 2023.12 MoE 架构,开放权重
Mistral 8x22B 2024.4 MoE 大模型
Mistral Large 2024.2 闭源对标 GPT-4
Mistral Small / Medium 2024 多种规格

Mistral 的双轨策略:

  • 开源小模型(建立生态);
  • 闭源大模型(商业化收入)。

五、中国开源大模型(2024 – 至今)

5.1 智谱 AI(GLM 系列)

    • 2024 GLM-4 开源;
    • ChatGLM 系列是中国早期开源大模型(2022 起);
    • 智谱 AI(北京,2019 创立)—— 清华系,开源 + 闭源混合。

5.2 阿里通义千问(Qwen)

  • Qwen-7B/14B/72B(2023.4)开源;
  • Qwen-VL 多模态开源;
  • Qwen-2(2024.6)开源;
  • Qwen-2.5(2024.9)—— 训练数据 18 万亿 token,号称”开源 SOTA”;
  • Qwen-3(2025)—— 进一步逼近 GPT-4。

Qwen 是中国开源大模型的代表——在 Hugging Face 下载量长期排名前列。

5.3 百度文心(ERNIE)

    • 文心 4.0 闭源为主,部分开源(ERNIE-ViLG 等);
    • 与阿里、字节错位竞争。

5.4 字节豆包(Doubao)

    • 字节 2024 年发布豆包大模型;
    • 价格战主力(每千 token 0.8 厘 vs OpenAI 数十倍)。

5.5 DeepSeek(深度求索)—— 2025 美股地震

DeepSeek 是 2025 年最戏剧性的 AI 公司:

  • 2024.12 DeepSeek-V3 发布——671B 参数 MoE,开源;
  • 2025.1 DeepSeek-R1 发布——推理模型,性能对标 OpenAI o1;
  • 2025.1.27 美股因 DeepSeek 暴跌——英伟达单日跌 17%(市值蒸发 6000 亿美元);
  • 训练成本仅约 600 万美元(vs OpenAI 数亿美元)。

DeepSeek 的意义:

1. 开源大模型可以逼近闭源前沿模型;

2. 训练成本可以大幅降低(算法 + 工程优化);

3. AI 集中化的护城河被打破——单家公司难以独占领先优势。

六、开源大模型生态

6.1 Hugging Face

Hugging Face 是开源大模型的事实平台:

    • 2022 年估值 20 亿美元;
    • 2025 年估值 45 亿美元;
    • 平台托管 100+ 万模型;
    • Transformers 库被所有 AI 公司使用。

6.2 中国开源平台

    • ModelScope(阿里达摩院,2022)—— 中国版 Hugging Face;
    • ModelZoo(开源中国)—— 中文 AI 模型社区;
    • 始智 AI(Wisemodel)—— 中文开源大模型平台。

6.3 微调框架

  • LLaMA-Factory(中国开发者)—— 最流行 LLaMA 微调框架;
  • Unsloth—— 速度提升 2-5 倍的微调工具;
  • Axolotl—— 简化微调流程;
  • Hugging Face TRL—— 强化学习微调。

七、开源 vs 闭源:核心争议

7.1 支持开源的理由

1. 透明性——可审查、可重现;

2. 民主化——每个人都能用 AI;

3. 生态——社区贡献推动模型进步;

4. 数据主权——数据不出本地;

5. 安全——多方审查发现漏洞;

6. 学术研究——可重复验证。

7.2 支持闭源的理由

1. 商业可持续——保护商业模式;

2. 安全——防止 AI 滥用;

3. 性能领先——闭源有更多资源;

4. 责任——闭源公司承担责任;

5. 防止恶意使用——避免被坏人利用。

7.3 监管立场

  • 欧盟 AI Act——不强制开源,但要求训练数据透明度;
  • 美国——倾向监管而不强制开源;
  • 中国——《生成式 AI 办法》要求”安全可控”,但鼓励开源生态;
  • Meta 立场——开源是”AI 民主化”,防止 AI 集中;
  • OpenAI 立场——闭源是”安全可控”。

八、未来 5 年:开源大模型的下一波

8.1 趋势预测

    • 开源追上闭源——开源模型性能继续逼近闭源前沿;
    • 训练成本下降——DeepSeek 模式被广泛复制;
    • 垂直模型爆发——医疗、法律、教育、金融等垂直开源模型;
    • 端侧部署——手机、汽车、IoT 设备上的开源小模型;
    • 国家力量——各国把”开源大模型”上升为国家战略。

8.2 关键不确定因素

  • AGI 时间点——AGI 临近时,开源是否受限?
  • 监管——AI Act + 各国监管可能限制开源;
  • 地缘政治——开源 vs 闭源成为”中美 AI 战”前线;
  • 商业可持续——开源公司如何持续盈利?

九、结语:开源大模型是 AI 时代的”GNU 运动”

回到 1998 年——Linux 和 GNU 运动证明了开源软件可以挑战微软;到 2025 年,DeepSeek 证明了开源大模型可以挑战 OpenAI。

开源大模型 5 年告诉我们:

  • 开源不是慈善,而是技术 + 商业 + 哲学的综合选择;
  • 开源不是低性能,而是”开放 + 性能”的组合;
  • 开源不是无序,而是社区驱动的新协作方式。

未来 5 年,开源大模型将从”挑战者”变成”主流”——这是 AI 时代的 GNU 运动。

CXOU AI 未来大会 · 报名通道限时开启
💬 评论
🔗 本文链接

📰 你可能也喜欢

AI编程70年:从Lisp机器到GitHub Copilot的进化史 AI 大事记

AI编程70年:从Lisp机器到GitHub Copilot的进化史

"AI 让机器自己写代码"这件事,人类追了 70 年。从 1950 年代 AI 诞生之初把它当作终极目标,到 2020 年代终于以 LLM 形式跑通——中间经历…
📅 09-27 · 👁 2026年9月27日
具身智能 50 年:从 Shakey 到 Figure 01 的机器人进化史 AI 大事记

具身智能 50 年:从 Shakey 到 Figure 01 的机器人进化史

"具身智能"(Embodied AI)指让 AI 拥有物理身体、与真实世界交互的能力。从 1960 年代 Stanford 的 Shakey 机器人开始,人类就…
📅 09-27 · 👁 2026年9月27日
AI芯片战争:除 NVIDIA 之外的算力诸侯演义 AI 大事记

AI芯片战争:除 NVIDIA 之外的算力诸侯演义

AI 算力的中心虽然是 NVIDIA,但故事远不止黄仁勋一家。从 Google 的 TPU 到华为昇腾、寒武纪、AMD MI300,再到 Cerebras、Gr…
📅 09-27 · 👁 2026年9月27日
AI制药10年:从 AlphaFold 到 Insilico Medicine 的药物发现革命 AI 大事记

AI制药10年:从 AlphaFold 到 Insilico Medicine 的药物发现革命

AI for Science 是 2020 年代 AI 最重要的应用方向之一,而 AI 制药是其中最热门的赛道。2016 年起,深度学习开始系统性地改造药物发现…
📅 09-27 · 👁 2026年9月27日
AI监管全球图景:美国、中国、英国、日本、韩国的路线分野 AI 大事记

AI监管全球图景:美国、中国、英国、日本、韩国的路线分野

AI 监管没有全球统一答案。欧盟 AI Act 率先立法,但实施路径仍在调整;美国走"轻监管、强创新"路线;中国走"包容审慎"路线;英国、日本、韩国各有特色——…
📅 09-27 · 👁 2026年9月27日
OpenAI / Anthropic / DeepMind 三巨头创业史 AI 大事记

OpenAI / Anthropic / DeepMind 三巨头创业史

2026 年全球大模型市场由三家公司主导:OpenAI(GPT 系列)、Anthropic(Claude 系列)、Google DeepMind(Gemini …
📅 09-26 · 👁 2026年9月26日