数智化转型网 人工智能资讯 每日人工智能资讯|微软自研双模型MAI-Image-2.5-Pro与MAI-Voice-2-Flash发布:不蒸馏第三方,已落地Bing和PowerPoint

每日人工智能资讯|微软自研双模型MAI-Image-2.5-Pro与MAI-Voice-2-Flash发布:不蒸馏第三方,已落地Bing和PowerPoint

微软于 7 月 23 日宣布推出两款自研AI模型MAI-Image-2.5-Pro和MAI-Voice-2-Flash,均已进入公开预览阶段。两款模型分别面向高质量图像生成与高并发语音交互场景,微软强调其训练数据经过清理和可追踪,不依赖第三方模型蒸馏,从底层设计就直接服务于微软产品用户。数智化转型网www.szhzxw.cn

一、图像模型精度最高,GPU成本最高降84%

MAI-Image-2.5-Pro是微软目前精度最高的图像模型,面向主视觉图片生成、细节编辑及图像内文字渲染等高要求场景,支持自然语言编辑指令。该模型已在Bing Image Creator中成为默认图像生成模型,在PowerPoint中用于图像到图像编辑功能,与GPT-Image- 2 相比可降低最高84%的GPU成本。在OneDrive中部署后,相关场景保存成功率提升26%,P95 延迟降低约25%,中等负载生产环境效率提升2. 5 倍。数智化转型网www.szhzxw.cn

定价方面,文本输入每百万Token收费 5 美元,图像输出每百万Token收费 106 美元。数智化转型网www.szhzxw.cn

二、语音模型速度提升 2 倍,已服务T-Mobile等客户

MAI-Voice-2-Flash针对高频语音应用优化,相比上一代速度提升约 2 倍,成本降低32%,适用于客服中心和语音助手等快速响应场景。该模型已接入Dynamics 365 Contact Center,为T-Mobile、EasyJet等客户提供服务,GPU成本最高降低89%。微软还将其集成至Azure Voice Live服务,支持开发者构建语音到语音交互智能体。

此外,同系列的MAI-Transcribe-1. 5 已应用于医疗语音解决方案Dragon Copilot,被 17 万名医疗服务提供者使用,上季度处理 2800 万次患者问诊记录,支持 58 种语言,多数语言转录错误率相对下降50%。微软透露下一代GB200 计算集群已投入运行,MAI系列模型将持续扩展。数智化转型网www.szhzxw.cn

若您对人工智能感兴趣或为人工智能创始人,可添加数智化转型网小助手思思微信加入人工智能交流群。若您在寻找人工智能供应商,可联系数智化转型网小助手思思(17757154048,微信同号)

思思企微
思思企微

若您为人工智能服务商,可添加数智化转型网小助手Jasper,加入人工智能行业交流群。

鹿鸣企微
Jasper企微

声明:本文来自数智化转型网,版权归作者所有。文章内容仅代表作者独立观点,不代表数智化转型网立场,转载目的在于传递更多信息。如有侵权,请联系我们。

底部图片
免责声明: 本网站(http://www.szhzxw.cn/)内容主要来自原创、合作媒体供稿和第三方投稿,凡在本网站出现的信息,均仅供参考。本网站将尽力确保所提供信息的准确性及可靠性,但不保证有关资料的准确性及可靠性,读者在使用前请进一步核实,并对任何自主决定的行为负责。本网站对有关资料所引致的错误、不确或遗漏,概不负任何法律责任。 本网站刊载的所有内容(包括但不仅限文字、图片、LOGO、音频、视频、软件、程序等) 版权归原作者所有。任何单位或个人认为本网站中的内容可能涉嫌侵犯其知识产权或存在不实内容时,请及时通知本站,予以删除。https://www.szhzxw.cn/134993.html
联系我们

联系我们

17717556551

邮箱: editor@cxounion.org

关注微信
微信扫一扫关注我们

微信扫一扫关注我们

关注微博
返回顶部