中国数智化转型网 人工智能资讯 每日人工智能资讯|黑森林实验室放出 Flux3:首个原生生成音频的多模态基础模型,20 秒音画同步一次成型

每日人工智能资讯|黑森林实验室放出 Flux3:首个原生生成音频的多模态基础模型,20 秒音画同步一次成型

德国人工智能初创公司黑森林实验室(Black Forest Labs)正式发布多模态基础模型 Flux3。它基于 Self-Flow 架构打造,配备专用的图像、视频、音频及动作编解码器,把对物理世界与数字环境的统一理解与生成揽到了一起。

最扎眼的一点是音视频同步。Flux3是首个支持原生音频生成的多模态模型,一次就能吐出长达20秒的音视频同步片段,能力覆盖文本、图像、视频转视频,基于关键帧的转场,以及多角色对话等。对一支模型来说,把”听得见”和”看得见”捏成同一套底座,意味着它不再只是图像或视频的单科选手。数智化转型网www.szhzxw.cn

早期测试里,在720p 分辨率、10秒片段的设置下,Flux3把 Luma Ray3.2按93% 的胜率压了下去,对 Runway Gen-4.5也有77% 的胜率优势;即便摆到 Seedance2.0与 Gemini Omni Flash 这类顶尖模型面前,它仍守住了微弱上风。

动作也被它伸进了现实。黑森林实验室联合 Mimic Robotics 开发了面向机器人领域的动作模型 Flux-mimic,目前已在奥迪工厂跑起了生产任务测试——多模态能力从屏幕里走到了产线上。发布节奏上,BFL 选择分阶段推进:Flux3Video 已经先上线,Flux3Image 与带开源权重的 “Flux3Dev” 也将在近期陆续放出。

若您对人工智能感兴趣或为人工智能创始人,可添加数智化转型网小助手思思微信加入人工智能交流群。若您在寻找人工智能供应商,可联系数智化转型网小助手思思(17757154048,微信同号)

思思企微
思思企微

若您为人工智能服务商,可添加数智化转型网小助手Jasper,加入人工智能行业交流群。

鹿鸣企微
Jasper企微

声明:本文来自数智化转型网,版权归作者所有。文章内容仅代表作者独立观点,不代表数智化转型网立场,转载目的在于传递更多信息。如有侵权,请联系我们。

底部图片
免责声明: 本网站(http://www.szhzxw.cn/)内容主要来自原创、合作媒体供稿和第三方投稿,凡在本网站出现的信息,均仅供参考。本网站将尽力确保所提供信息的准确性及可靠性,但不保证有关资料的准确性及可靠性,读者在使用前请进一步核实,并对任何自主决定的行为负责。本网站对有关资料所引致的错误、不确或遗漏,概不负任何法律责任。 本网站刊载的所有内容(包括但不仅限文字、图片、LOGO、音频、视频、软件、程序等) 版权归原作者所有。任何单位或个人认为本网站中的内容可能涉嫌侵犯其知识产权或存在不实内容时,请及时通知本站,予以删除。https://www.szhzxw.cn/134715.html
联系我们

联系我们

17717556551

邮箱: editor@cxounion.org

关注微信
微信扫一扫关注我们

微信扫一扫关注我们

关注微博
返回顶部