
一、早期实验期:电脑生成艺术的开端(1966-1990)
1966 年 2 月,位于德国斯图加特的西门子公司研究中心(CSG)运行了第一个计算机艺术展览——程序用 PDP-6 主机生成几何图案,在打印机上输出。这是人类历史上第一个公开展出的”电脑艺术”。
同期(1966 年),德国艺术家 Frieder Nake 设计了 “Matrix Multiplication”——让计算机根据概率生成抽象图。1968 年,法国巴黎蓬皮杜艺术中心举办了展览 “Cybernetic Serendipity”(控制论奇遇),首次系统展示电脑生成艺术,被视为 AI 艺术的起点。
1968-1990 年是”规则派”AI 艺术的黄金期:
- **Vera Molnár**(匈牙利裔法籍艺术家):1968 年开始用程序生成几何图案,被称为”电脑艺术之母”
- **Manfred Mohr**(德国艺术家):1971 年开始用程序生成条带状抽象画
- **Roman Verostko**(美国艺术家):1980 年代开始用程序绘制书法式绘画
- **Harold Cohen / AARON**(如前所述,1968-2016 持续 50 年)
这一时期所有 AI 艺术都是**纯规则系统**——艺术家编写算法,让计算机根据预设规则生成图案。没有学习,没有 AI,本质上是”算法艺术家”而非”AI 艺术家”。
真正的范式跳跃要等到 1990 年代——神经网络终于开始能生成图像了。
二、神经派萌芽:从 BP 神经网络到 DeepDream(1990-2014)
1986 年,Rumelhart 和 Hinton 发表反向传播(Backpropagation)算法,神经网络终于能”学习”复杂函数。1989 年,Yann LeCun 在贝尔实验室用反向传播训练 LeNet 手写数字识别——这是卷积神经网络(CNN)的雏形。
但”神经网络生成图像”被遗忘了一段时间。直到 2014 年——这一年发生了两件大事。
**事件一:Ian Goodfellow 发表 GAN(生成对抗网络)**
2014 年 6 月,Ian Goodfellow 在 NeurIPS 上发表 GAN 论文——生成器(Generator)和判别器(Discriminator)对抗训练,让生成器能生成越来越逼真的图像。这是图像生成领域的”GPT 时刻”——从规则生成到神经网络生成,AI 终于能”创造”全新的视觉内容。
**事件二:DeepDream(Google Inceptionism)引爆 AI 艺术大众化**
2015 年 6 月,Google 工程师 Alexander Mordvintsev 在 Google 博客发布 DeepDream(又称 Inceptionism)。DeepDream 实际上是 Google Inception 图像分类网络的副产品——研究人员把”分类猫”的梯度反向传播到输入图像,反复放大”猫”的特征。结果生成了充满幻觉、狗脸、人脸、几何图案的迷幻图像。
DeepDream 的意义不在技术,而在**大众影响**——它在 Reddit、Twitter 病毒式传播,让普通用户第一次感受到”AI 能创造美”。Google 立即开源 DeepDream 代码,2015-2016 年全球出现了数千个 DeepDream 艺术项目。
同期(2014-2017)AI 艺术里程碑:
- **Neural Style Transfer**(2015 年,Gatys et al.):用 CNN 把一张图的风格迁移到另一张图,梵高星空风格的家猫照片成为网络爆款
- **Prisma App**(2016 年 6 月):把 Style Transfer 商业化,3 天内下载 1000 万次
- **StackGAN / StackGAN++**(2016 年):用 GAN 从文本生成 256×256 图像(鸟、花)
- **Pix2Pix**(2016 年):图像到图像翻译(草图→照片)
但这一阶段的 AI 艺术仍受限于:
- **分辨率低**:GAN 生成的图像最大 256×256
- **可控性差**:文本描述与生成图像对应关系弱
- **训练慢**:单次 GAN 训练需要几天到几周
真正的拐点是 2020 年的 DALL·E。
三、Transformer 时代:从 DALL·E 到 Stable Diffusion(2020-2022)
2020 年 12 月,OpenAI 内部演示了一个叫 DALL·E 的模型——它能从文本”画”出长颈鹿、宇航员骑恐龙、刺猬摩天大楼等荒诞组合。2021 年 1 月 5 日,OpenAI 公开 DALL·E 论文和博客,瞬间引爆 AI 艺术界。
DALL·E 的核心技术是 **CLIP + Transformer**:
- **CLIP**(2021 年 1 月同时发布):把图像和文本映射到同一向量空间,让模型理解”什么文本对应什么图像”
- **Transformer 架构**:从 NLP 领域借鉴,处理”文本→图像”的序列到序列映射
DALL·E 1 代(2021 年 1 月)能生成 256×256 图像,组合能力强但分辨率仍低。2022 年 4 月,OpenAI 发布 **DALL·E 2**,基于 Diffusion 模型,能生成 1024×1024 图像,质量大幅跃升。
同期,Google 发布 **Imagen**(2022 年 5 月)和 **Parti**(2022 年 6 月),从不同技术路线竞争。
但真正改变游戏规则的是 **Stable Diffusion**。
2022 年 8 月 22 日,德国慕尼黑的初创公司 **Stability AI** 发布 Stable Diffusion——基于 Latent Diffusion Model(LDM),由 CompVis 团队在慕尼黑大学和 Runway 合作开发。
Stable Diffusion 的革命性意义:
- **开源免费**:模型权重完全公开,ComfyUI / Automatic1111 等本地部署工具链一周内出现
- **可商用**:允许商业用途,催生 Midjourney、Civitai、Leonardo 等完整生态
- **可定制**:用户能在本地训练自己的 LoRA(低秩适配)模型,定制特定风格
Stable Diffusion 发布的当周:
- GitHub 上 ComfyUI 仓库获得 10000+ star
- Civitai(AI 模型分享平台)注册用户突破 100 万
- Midjourney 宣布用户突破 100 万(基于 Discord)
到 2022 年底,AI 艺术正式进入”大众创作”时代——任何人都能用文字描述生成专业级图像。
四、商业爆发期:Midjourney / Runway / Adobe / 国内厂商(2022-2024)
2022 年 7 月,**Midjourney** 在 Discord 上线——它是基于 Stable Diffusion 微调的闭源模型。Midjourney 凭借精致的审美、活跃的社区、Discord 原生的高效传播,到 2023 年 8 月付费用户突破 1500 万,估值 100 亿美元。
2022 年 11 月,**Runway ML** 推出 Gen-2,能从文本生成视频片段(4 秒)——AI 视频时代的开端。2024 年 2 月,OpenAI 推出 **Sora**——能生成 60 秒 1080p 视频,瞬间成为全球焦点。
2023 年 3 月,**Adobe** 推出 Firefly,集成到 Photoshop、Illustrator、Premiere Pro 全家桶。Adobe 的策略是”AI 辅助而不取代”——AI 生成内容有版权追溯,训练数据来自 Adobe Stock,避免版权风险。
2024 年 2 月,**Google** 推出 Gemini 1.5 原生多模态版本,图像理解和生成一体化。2024 年 5 月,**Apple** 在 iOS 18 集成 Image Playground。
中国市场(2022-2024):
- **百度文心一格**(2022 年 8 月):国内首个商用 AI 图像生成
- **阿里通义万相**(2023 年 7 月)
- **腾讯混元图像**(2023 年 9 月)
- **字节豆包图像**(2023 年 8 月)
- **快手可图(Kling)**(2024 年 6 月):主攻 AI 视频,与 Runway / Sora 竞争
- **生数科技 Vidu**(2024 年 4 月):清华团队创业,多镜头连贯视频生成
**中国市场的特色**:
- **价格战**:2024 年百度文心一格把价格打到 0.1 元/张图片
- **合规先行**:所有国内厂商都内置”AI 生成”水印和版权声明
- **本土化 prompt**:中文 prompt 优化比英文模型好 30-50%
五、版权战争:从 Stable Diffusion 被告到 Creative Commons(2023-2026)
AI 艺术的爆发带来了版权危机——训练数据用了几十亿张图片,绝大多数未经授权。2023 年,全球艺术家集体诉讼 Stability AI、Midjourney、DeviantArt 三家公司,指控”未经授权使用艺术家作品训练模型”。
关键事件时间线:
- **2023 年 1 月**:三位艺术家(Andersen、McKernan、Ortiz)在加州联邦法院起诉 Stability AI 等
- **2023 年 7 月**:美国版权局裁定”纯 AI 生成的图像不受版权保护”
- **2024 年 2 月**:ComfyUI 出现多种”版权规避”工具,引发新一轮争议
- **2024 年 8 月**:美国科罗拉多州法院驳回艺术家大部分诉讼请求,但允许部分继续
- **2025 年 3 月**:欧盟《AI Act》生效,要求所有 AI 生成内容必须标注
- **2025 年 6 月**:Adobe / Getty Images / Shutterstock 与艺术家达成集体和解,训练数据授权费用达数亿美元
- **2026 年 1 月**:中国《生成式 AI 服务管理暂行办法》修订版生效,要求 AI 生成内容永久水印 + 训练数据备案
**版权战争没有赢家,但产生了三个新行业**:
1. **AI 训练数据授权市场**:Getty Images、Shutterstock 开始授权训练数据,年收入数千万美元
2. **AI 艺术家认证**:Spawning.ai 等公司提供”主动退出训练”工具
3. **AI 内容合规检测**:Hive、Optic 等公司提供 AI 生成图像检测工具
六、十字路口:AI 艺术的下一个 50 年
从 1968 年 Harold Cohen 的 AARON 到 2026 年的今天,AI 艺术走过了 58 年。下一个 10 年的关键问题:
**1) AI 是”工具”还是”作者”?**
美国版权局已经裁定纯 AI 生成图像不受版权保护——这意味着 AI 本身不能成为作者。但中国和欧盟采取更灵活立场:人类 + AI 协作内容有版权。**这个边界在未来 10 年仍会反复争议**。
**2) Style 模仿的伦理边界在哪里?**
当 Stable Diffusion 能在 1 分钟内学会一个画家的风格(LoRA 训练),这位画家的市场价值是什么?2025 年起,多个国家开始立法要求”风格模仿”必须经原始艺术家授权——但执行极难。
**3) AI 艺术会”取代”人类艺术家吗?**
2026 年的答案:**不会取代,但会改变角色**。商业插画、广告设计、UI icon 等”标准化需求”已被 AI 替代 70% 以上,但”原创艺术、装置艺术、个人表达”等”非标准化需求”AI 仍无法替代。**AI 让艺术变成两极分化——金字塔尖的艺术家更值钱,金字塔底的设计师被替代**。
AARON 画了 50 年没人买,Harold Cohen 一生都没成为艺术大师。但 50 年后,全世界最赚钱的”AI 艺术家”是真正掌握 prompt + LoRA 训练 + ComfyUI 工作流的人。**艺术的本质没变——表达、情感、独创性——但表达的工具变了**。
1968 年 PDP-8 小型计算机画的第一张抽象画,到 2026 年的 4K 实时 AI 绘画,58 年里人类只做了一件事:**让”机器能创作”从科幻变成日常**。下一个 10 年,AI 艺术会从”生成图像”进化到”理解艺术”——AI 也许不会成为艺术家,但会成为人类艺术家最不可或缺的工具。