音频生成 (4 个模型)
Qwen3 LiveTranslate Flash
Qwen3-LiveTranslate-Flash 是阿里通义多语言实时音视频同传模型,基于 Qwen3-Omni 基座,支持 18 种语言及方言的离线/实时翻译,3 秒低延迟。
Qwen3 Omni 30B Captioner
Qwen3-Omni-30B-A3B-Captioner 是阿里开源的音频精细字幕模型,音频输入转文本输出,特点是详细且低幻觉的音频描述。
Qwen3 TTS Flash Realtime
Qwen3-TTS-Flash-Realtime 是阿里通义实时文本转语音模型,首包延迟 97ms,支持 17 种音色、10 种语言及 17 种方言。
Qwen3 TTS Flash
Qwen3-TTS-Flash 是阿里通义推出的文本转语音模型,支持 10 种语言、17 种音色及 9 种中文方言,可智能调节语气,首包延迟 97ms,适用于智能客服、有声创作、语音助手等场景。