
时间线主轴
2004 – EMI 首发「Computer Cantata」加州大学圣克鲁兹分校 David Cope 教授团队发布 EMI(Experiments in Musical Intelligence)系统生成的「计算机康塔塔」,引发学术界对 AI 创作版权的第一次大讨论。
2010 – Magenta 项目启动Google Brain 启动 Magenta 研究计划,目标是用深度学习生成音乐、绘画、视频。同期 Sony CSL 巴黎发布 FlowMachines 系统,写出披头士风格的”Daddy’s Car”。
2016 – WaveNet 与端到端音频生成Google DeepMind 发布 WaveNet,首次实现端到端语音合成(接近真人音质),后续演进为 Lyria 模型。
2018 – OpenAI MuseNetOpenAI 发布 MuseNet,能够生成 10 种乐器、4 分钟长的多风格音乐作品,标志着生成模型开始处理长序列音乐结构。2020 – Jukebox 跨时代升级OpenAI 发布 Jukebox,能够生成带人声演唱的完整歌曲(包括模仿特定歌手音色),但音质仍未达商用标准。2022 – AudioCraft + Stable AudioMeta 发布 AudioCraft(含 MusicGen),Stability AI 发布 Stable Audio,音乐生成开始进入开源时代。2024 – Suno / Udio 爆红Suno V3 和 Udio v2 在 2024 年相继发布,能够在 30 秒内生成 2-4 分钟商用级音乐(带人声、混音、编曲),引发唱片业大规模诉讼(RIAA 2024-06 起诉 Suno/Udio 版权侵权)。2025 – 行业格局重构Suno/Udio 与主要唱片公司达成和解,引入”训练数据白名单”机制。Apple Music / Spotify 上线”AI 音乐专区”。2026 – 多模态统一Google Lyria 2 / Suno V4 实现”音频 + 视频 + 歌词”多模态联合生成,标志着 AI 音乐正式进入”全模态创作”时代。
关键节点小结
- 2004-2015:实验期(学术驱动,无商业落地)
- 2016-2020:技术爆发期(深度学习主导,质量快速提升)
- 2021-2023:工具期(开源生态形成,但未被主流采纳)
- 2024-:产业期(版权战争 + 商业落地 + 行业重构)