据机器之心、量子位7月29日报道,字节跳动旗下豆包大模型团队已完成新一代豆包Mega 2.0的首轮内部测试,参数规模突破3万亿,原生支持多模态理解与10分钟级长视频生成。Mega 2.0预计2026年Q4正式发布,将接替豆包Mega 1.5成为字节旗下最强基座模型。
豆包Mega 2.0的核心突破在于「原生多模态对齐」技术架构。Mega 2.0采用端到端多模态Transformer架构,文本、图像、视频、音频统一编码到同一向量空间,从根本上解决了传统多模态模型的模态对齐损耗问题。Mega 2.0在30项多模态理解基准测试中刷新SOTA,其中VideoMME得分87.2%,MMMU-Pro得分82.1%,均领先GPT-5.6 Sol版。
豆包Mega 2.0的10分钟级长视频生成能力是其另一核心突破。传统视频生成大模型受限于显存与算力,单次生成时长通常不超过30秒。豆包Mega 2.0通过创新的「分镜自动生成+一致性维护」技术架构,实现单次生成10分钟级连贯长视频,已在抖音电商、巨量引擎、西瓜视频等业务场景完成内部测试。
字节跳动AI Lab负责人表示,豆包Mega 2.0将在2026年Q4通过火山引擎机器学习平台对外提供API服务,定价较GPT-5.6 Sol版降低60%以上。豆包Mega 2.0训练采用华为昇腾950PR集群完成,单次训练任务调用超过8192张昇腾950DT卡,是国产AI算力首次支撑万亿级参数大模型完成训练任务。
豆包Mega 2.0的训练数据规模与质量也达到行业领先水平。Mega 2.0预训练数据总量达50万亿tokens,覆盖中文、英文、日文、韩文、法文、德文、西班牙文7种语言,包含1800万小时视频数据、120亿张图像数据、100亿条音频数据。豆包Mega 2.0同步与中央广播电视总台、爱奇艺、优酷等头部内容平台达成战略合作,将Mega 2.0的视频生成能力应用于短视频、长剧集、纪录片等内容生产场景。Mega 2.0的10分钟级长视频能力还将驱动字节跳动在电影、广告、游戏CG等长内容生产场景的AI革命。
若您对人工智能感兴趣,可添加数智化转型网小助手思思微信加入人工智能交流群。若您在寻找人工智能供应商,可联系数智化转型网小助手思思(17757154048,微信同号)

若您为人工智能服务商,可添加数智化转型网小助手Nora,加入人工智能行业交流群。

若您为人工智能创业者,可添加数智化转型网社群主理人Carina,加入人工智能创业交流群。

声明:本文来自数智化转型网,版权归作者所有。文章内容仅代表作者独立观点,不代表数智化转型网立场,转载目的在于传递更多信息。如有侵权,请联系我们。

本文由数智化转型网(www.szhzxw.cn)转载,编辑/翻译:数智化转型网(Professionalism Achieves Leadership 专业造就领导者)迅龙
