中国数智化转型网 人工智能资讯 每日人工智能资讯|字节豆包Mega 2.0首测曝光 3万亿参数原生多模态视频生成

每日人工智能资讯|字节豆包Mega 2.0首测曝光 3万亿参数原生多模态视频生成

据机器之心、量子位7月29日报道,字节跳动旗下豆包大模型团队已完成新一代豆包Mega 2.0的首轮内部测试,参数规模突破3万亿,原生支持多模态理解与10分钟级长视频生成。Mega 2.0预计2026年Q4正式发布,将接替豆包Mega 1.5成为字节旗下最强基座模型。

豆包Mega 2.0的核心突破在于「原生多模态对齐」技术架构。Mega 2.0采用端到端多模态Transformer架构,文本、图像、视频、音频统一编码到同一向量空间,从根本上解决了传统多模态模型的模态对齐损耗问题。Mega 2.0在30项多模态理解基准测试中刷新SOTA,其中VideoMME得分87.2%,MMMU-Pro得分82.1%,均领先GPT-5.6 Sol版。

豆包Mega 2.0的10分钟级长视频生成能力是其另一核心突破。传统视频生成大模型受限于显存与算力,单次生成时长通常不超过30秒。豆包Mega 2.0通过创新的「分镜自动生成+一致性维护」技术架构,实现单次生成10分钟级连贯长视频,已在抖音电商、巨量引擎、西瓜视频等业务场景完成内部测试。

字节跳动AI Lab负责人表示,豆包Mega 2.0将在2026年Q4通过火山引擎机器学习平台对外提供API服务,定价较GPT-5.6 Sol版降低60%以上。豆包Mega 2.0训练采用华为昇腾950PR集群完成,单次训练任务调用超过8192张昇腾950DT卡,是国产AI算力首次支撑万亿级参数大模型完成训练任务。

豆包Mega 2.0的训练数据规模与质量也达到行业领先水平。Mega 2.0预训练数据总量达50万亿tokens,覆盖中文、英文、日文、韩文、法文、德文、西班牙文7种语言,包含1800万小时视频数据、120亿张图像数据、100亿条音频数据。豆包Mega 2.0同步与中央广播电视总台、爱奇艺、优酷等头部内容平台达成战略合作,将Mega 2.0的视频生成能力应用于短视频、长剧集、纪录片等内容生产场景。Mega 2.0的10分钟级长视频能力还将驱动字节跳动在电影、广告、游戏CG等长内容生产场景的AI革命。

若您对人工智能感兴趣,可添加数智化转型网小助手思思微信加入人工智能交流群。若您在寻找人工智能供应商,可联系数智化转型网小助手思思(17757154048,微信同号)

思思微信二维码

若您为人工智能服务商,可添加数智化转型网小助手Nora,加入人工智能行业交流群。

Nora微信二维码

若您为人工智能创业者,可添加数智化转型网社群主理人Carina,加入人工智能创业交流群。

Carina微信二维码

声明:本文来自数智化转型网,版权归作者所有。文章内容仅代表作者独立观点,不代表数智化转型网立场,转载目的在于传递更多信息。如有侵权,请联系我们。

底部图片
免责声明: 本网站(http://www.szhzxw.cn/)内容主要来自原创、合作媒体供稿和第三方投稿,凡在本网站出现的信息,均仅供参考。本网站将尽力确保所提供信息的准确性及可靠性,但不保证有关资料的准确性及可靠性,读者在使用前请进一步核实,并对任何自主决定的行为负责。本网站对有关资料所引致的错误、不确或遗漏,概不负任何法律责任。 本网站刊载的所有内容(包括但不仅限文字、图片、LOGO、音频、视频、软件、程序等) 版权归原作者所有。任何单位或个人认为本网站中的内容可能涉嫌侵犯其知识产权或存在不实内容时,请及时通知本站,予以删除。https://www.szhzxw.cn/134255.html
联系我们

联系我们

17717556551

邮箱: editor@cxounion.org

关注微信
微信扫一扫关注我们

微信扫一扫关注我们

关注微博
返回顶部