跳到主要内容
  • 登录
  • 注册

数智化转型网

  • 首页
  • 国内AI资讯
  • 海外AI资讯
  • 行业百科
  • 案例库
  • 行业研究
  • AI指数研究
  • 专题栏目
  • 模型算力洞察
  • IT/AI服务商信息库
  • 行业资讯
🔍
☰

模型分类

文本生成/大模型14 图像生成4 视频生成2 音频生成4 多模态3 代码生成2 向量/Embedding0 开源模型1

音频生成 (4 个模型)

Qwen3 LiveTranslate Flash
语音识别翻译多语言
Qwen3-LiveTranslate-Flash 是阿里通义多语言实时音视频同传模型,基于 Qwen3-Omni 基座,支持 18 种语言及方言的离线/实时翻译,3 秒低延迟。
阿里云 · 更新于 2025-09-22
Qwen3 Omni 30B Captioner
语音识别
Qwen3-Omni-30B-A3B-Captioner 是阿里开源的音频精细字幕模型,音频输入转文本输出,特点是详细且低幻觉的音频描述。
阿里云 · 更新于 2025-09-17
Qwen3 TTS Flash Realtime
语音合成多语言
Qwen3-TTS-Flash-Realtime 是阿里通义实时文本转语音模型,首包延迟 97ms,支持 17 种音色、10 种语言及 17 种方言。
阿里云 · 更新于 2025-09-16
Qwen3 TTS Flash
语音合成多语言
Qwen3-TTS-Flash 是阿里通义推出的文本转语音模型,支持 10 种语言、17 种音色及 9 种中文方言,可智能调节语气,首包延迟 97ms,适用于智能客服、有声创作、语音助手等场景。
阿里云 · 更新于 2025-09-16

产业资讯

  • 国内 AI 资讯
  • 海外 AI 资讯
  • AI 政策法规
  • AI 投融资
  • AI 大事记
  • AI 人物图谱
  • 专访栏目
  • 行业资讯

产业资料

  • 行业案例
  • 行业研究

供应商库

  • 服务商信息库
  • 服务商资讯

行业百科

  • 数字化转型 1000 问
  • 人工智能 1000 问
  • GEO 1000 问

© 2026 数智化转型网 . All rights reserved.  |  沪ICP备2021021104号