MiniMax 今天推出了音乐生成模型 MiniMax-Music3,输入歌词和音乐描述,就能生成最长5分钟的完整歌曲,输出为32kHz、16-bit 立体声 WAV 文件。数智化转型网www.szhzxw.cn
支撑这个能力的是一套分层自回归架构,两个模型各司其职、上下配合。全局语言模型 Global LLM 参数规模8B,逐帧预测第1个 RVQ 码本,专门负责建模歌曲的长程语义与结构变化——它是从 Qwen3-8B 初始化来的,训练时先让嵌入层和输出层适配音乐语义词元,再与局部模型联合建模全部码本;局部语言模型 Local LLM 参数只有0.6B,负责预测每一帧里其余的声学码本,把细粒度的声学信息一点点补回来。一个大模型管结构骨架,一个小模型填声音血肉,分工相当清晰。数智化转型网www.szhzxw.cn
官方表示,模型能在长音频中稳稳守住音乐主题、节奏、歌声身份和编曲的推进,前奏、主歌、预副歌、副歌、桥段、器乐间奏、尾奏这些结构一个不落。官方已在 GitHub 放出模型页面,并提供生成的歌曲示例供试听。
地址:https://huggingface.co/MiniMaxAI/MiniMax-Music3
若您对人工智能感兴趣或为人工智能创始人,可添加数智化转型网小助手思思微信加入人工智能交流群。若您在寻找人工智能供应商,可联系数智化转型网小助手思思(17757154048,微信同号)

若您为人工智能服务商,可添加数智化转型网小助手Jasper,加入人工智能行业交流群。

声明:本文来自数智化转型网,版权归作者所有。文章内容仅代表作者独立观点,不代表数智化转型网立场,转载目的在于传递更多信息。如有侵权,请联系我们。

本文由数智化转型网(www.szhzxw.cn)转载,编辑/翻译:数智化转型网(Professionalism Achieves Leadership 专业造就领导者)白龙
