Meta 首个实时音频感知模型来了:20 多人同时说话也能分轨转写,每千分钟 3 美元

Meta推出首个实时音频感知模型Muse Voice Transcribe,可通过Model API调用,定价 […]

Meta推出首个实时音频感知模型Muse Voice Transcribe,可通过Model API调用,定价每1000分钟3美元(约每小时0.18美元)。该模型整合流式语音识别、说话人分离与端点检测,支持边说边转写,无需等待整段音频,并可自动区分20余名说话者分轨输出。

一、边说边出字,20余名说话者自动分轨

该模型在同一流程中整合了流式自动语音识别、说话人分离与端点检测。所谓“流式”,就是边说边转写,模型不必等整段音频说完才出结果,而是一小段一小段持续输出文字,延迟更低,适合实时听写、会议记录、通话字幕等场景。用户说话时,系统可同步输出文字,无需等待完整录音结束后再单独处理。 Muse Voice Transcribe 可在包含20余名说话者的录音中分离不同发言者,还能识别说话是否结束,从而自动确定一段输入的边界。在语言支持上,模型训练覆盖70余种语言,其中25种在发布时完成验证;支持长度超过1小时的音频,也支持句内或句间的自然语言切换。开发者还可通过语言、关键词和上下文偏置,提升特定语言、术语或场景下的识别效果。

二、自适应延迟机制平衡速度与准确率

为了兼顾实时响应和识别准确度,Meta 引入了名为“自适应延迟”(adaptive delay)的动态决策机制。系统不会对所有词语采用固定的速度与准确度取舍,而是针对每个词判断需要额外接收多少音频后再输出识别结果:对于较容易识别的语音,系统会更快提交转写结果;而对于发音不清、术语较多或语境复杂的词语,则调用更多前后文音频信息来提升准确度。 Meta 方面表示,截至2026年9月1日,Muse Voice Transcribe 位列 Artificial Analysis 流式语音转文本排行榜第1名。

CXOU AI 未来大会 · 报名通道限时开启
💬 评论
🔗 本文链接

📰 你可能也喜欢

数智化转型网每日AI资讯 资讯

GPT-6 Astra测试数据罗生门:OpenAI频繁修改成绩引「刷榜」质疑,大模型基准测试信任危机爆发

AI资讯AI新闻资讯正文GPT-6 Astra测试数据罗生门:OpenAI频繁修改成绩引「刷榜」质疑,大模型基准测试信任危机爆发发布于AI新闻资讯发布时间 :2…
📅 09-20 · 👁 2026年9月20日
数智化转型网每日AI资讯 资讯

微软发布 MAI-Image-2.6-Flash:图像生成速度提升2.8倍,成本降低逾50%

AI资讯AI新闻资讯正文微软发布 MAI-Image-2.6-Flash:图像生成速度提升2.8倍,成本降低逾50%发布于AI新闻资讯发布时间 :2026年9月…
📅 09-20 · 👁 2026年9月20日
数智化转型网每日AI资讯 资讯

OpenAI首个达“关键”门槛的Astra因能力太强遭安全限速

OpenAI下一代模型Astra将推出,但严格限制其网络安全功能。该模型为首个达《准备框架》“关键”网络安全能 […]
📅 09-20 · 👁 2026年9月20日
数智化转型网每日AI资讯 资讯

OpenAI 发布 GPT-6Astra,黄仁勋称 AGI 已经到来

AI资讯AI新闻资讯正文OpenAI 发布 GPT-6Astra,黄仁勋称 AGI 已经到来发布于AI新闻资讯发布时间 :2026年9月7号 9:34阅读 :1…
📅 09-20 · 👁 2026年9月20日
数智化转型网每日AI资讯 资讯

Marvis上线自定义模型功能,支持接入Kimi、智谱GLM等主流模型

腾讯AI助手Marvis上线“自定义模型”功能,用户可接入腾讯云、阿里云、DeepSeek、Minimax、K […]
📅 09-20 · 👁 2026年9月20日
数智化转型网每日AI资讯 资讯

Claude攻克黎曼猜想历史大关,人类顶尖学者与机器联手书写跨物种神话

AI资讯AI新闻资讯正文Claude攻克黎曼猜想历史大关,人类顶尖学者与机器联手书写跨物种神话发布于AI新闻资讯发布时间 :2026年9月7号 9:36阅读 :…
📅 09-20 · 👁 2026年9月20日