数智化转型网 人工智能资讯 每日人工智能资讯|MiniMax发布通用全模态模型H3,15秒2K音视频生成价格不到主流模型三分之一

每日人工智能资讯|MiniMax发布通用全模态模型H3,15秒2K音视频生成价格不到主流模型三分之一

今日,AI公司MiniMax正式发布通用全模态生成模型MiniMax H3。该模型首次实现了文本、图像、视频、音频的统一理解与生成,打破了长期以来视频生成领域各任务、各模态相互割裂的局面,标志着多模态生成模型从”专用专家”向”通用助手”迈出关键一步。数智化转型网www.szhzxw.cn

据官方介绍,H3支持原生双声道音视频输出,最高可生成15秒2K分辨率内容。在前期邀测中,H3在指令遵循、品牌信息呈现、V2V动作迁移等场景下表现出商用级稳定性,已可应用于广告、电商、游戏、UI设计等多个商业领域。

技术层面,H3引入了Contextual Omni Representation(上下文全模态表示)技术,使自然语言成为连接各类模态的通用桥梁。用户只需用语言描述复杂关系——例如”参考某段视频的希区柯克式镜头运动,让指定图片中的人物唱出某段音频的歌声”——模型即可自动完成全链路理解与生成。配合自研的H3-VAE与In-context Regeneration技术,H3在2K分辨率下的每秒生成成本不到主流模型的1/3,768P分辨率下不到1/2,为行业提供了目前已知的最优性价比方案。

值得关注的是,MiniMax宣布将在未来几天内,在符合相关法律法规的前提下开源H3模型权重。这也是国产视频生成大模型首次面向社区开放权重,旨在推动开源生态建设并加速国产芯片适配。H3在设计初期就考虑了多款国产芯片的兼容性,其开源将进一步降低国内企业在多模态AI应用上的技术门槛。数智化转型网www.szhzxw.cn

MiniMax方面表示,H3目前仍存在画面精细度和模型规模上的提升空间,后续将推进H系列与M系列模型能力的融合,并通过Scaling持续扩展模型上限。数智化转型网www.szhzxw.cn

业内分析认为,H3的发布与开源或将改变闭源模型长期主导视频生成领域的格局,为多模态AI的普惠化应用按下加速键。数智化转型网www.szhzxw.cn

若您对人工智能感兴趣或为人工智能创始人,可添加数智化转型网小助手思思微信加入人工智能交流群。若您在寻找人工智能供应商,可联系数智化转型网小助手思思(17757154048,微信同号)

思思企微
思思企微

若您为人工智能服务商,可添加数智化转型网小助手Jasper,加入人工智能行业交流群。

鹿鸣企微
Jasper企微

声明:本文来自数智化转型网,版权归作者所有。文章内容仅代表作者独立观点,不代表数智化转型网立场,转载目的在于传递更多信息。如有侵权,请联系我们。

底部图片
免责声明: 本网站(http://www.szhzxw.cn/)内容主要来自原创、合作媒体供稿和第三方投稿,凡在本网站出现的信息,均仅供参考。本网站将尽力确保所提供信息的准确性及可靠性,但不保证有关资料的准确性及可靠性,读者在使用前请进一步核实,并对任何自主决定的行为负责。本网站对有关资料所引致的错误、不确或遗漏,概不负任何法律责任。 本网站刊载的所有内容(包括但不仅限文字、图片、LOGO、音频、视频、软件、程序等) 版权归原作者所有。任何单位或个人认为本网站中的内容可能涉嫌侵犯其知识产权或存在不实内容时,请及时通知本站,予以删除。https://www.szhzxw.cn/136249.html
联系我们

联系我们

17717556551

邮箱: editor@cxounion.org

关注微信
微信扫一扫关注我们

微信扫一扫关注我们

关注微博
返回顶部