Qwen-Audio-3.0-TTS 是阿里通义千问推出的语音合成大模型,包含面向实时交互的 Flash 版与面向高质量生成的 Plus 版。模型在 Artificial Analysis 全球 TTS 榜单中斩获冠军,支持细粒度标签控制、自然语言指令定义声音风格,覆盖 16 种语言与 20 种中文方言,音频输出提升至 48KHz 录音棚级品质,单次合成最长 3 分钟。

细粒度标签控制:文本中嵌入 [gasp]、[giggles]、[angry] 等结构化标签,精准调控语气、情绪与呼吸细节。
Free-style 指令控制:用自然语言描述角色、情绪、场景、语速,无需专业声学知识即可定义声音风格。
多语种与方言:覆盖中英日韩德等 16 种语言,支持广东、重庆、东北、上海等 20 种中文方言,10 种语言词错误率 SOTA。
复杂声学鲁棒性:原生嵌入语音增强能力,在高噪声、高混响环境下仍能准确克隆音色。
精品音色库:提供指令风格音色、方言音色、细粒度控制音色及 14+ 小语种音色,开箱即用。
48KHz 高品质输出:从 24KHz 升级至 48KHz,单次合成最长 3 分钟。
25Hz 分词器:单码本编解码器,强调语义内容,与 Qwen-Audio 无缝集成,通过块级 DiT 实现流式波形重建,适合高质量非流式场景。
12Hz 分词器:12.5Hz、16 层多码本设计,实现极端比特率压缩,配合轻量级因果 ConvNet 完成超低延迟流式重建,适合实时交互。
Plus 版:追求极致音质与表现力,适合影视配音、有声读物等场景。
Flash 版:追求低延时实时交互,适合直播、对话机器人等场景。
qwen-audio-3.0-tts-plus 或 qwen-audio-3.0-tts-flash 服务。[angry]、[gasp] 等结构化标签与 Free-style 自然语言指令,精准控制情绪、呼吸、语速与角色。| 维度 | Qwen-Audio-3.0-TTS-Plus | ElevenLabs v3 |
|---|---|---|
| 榜单排名 | Artificial Analysis 第 1 | 未进前 3 |
| 采样率 | 48KHz | 通常 44.1KHz |
| 标签控制 | 原生支持结构化标签 | 需通过 Prompt 间接控制 |
| 方言支持 | 20 种中文方言 | 有限 |
| 多语种 SOTA | 10 种语言词错误率最优 | 部分语种领先 |
| 噪声鲁棒性 | 原生语音增强 | 依赖干净参考音频 |
| API 定价 | $27.6 / 1M 字符 | 约 $11 / 1M 字符 |
免责声明:含第三方意见,不构成财务建议
Wan-Streamer v0.2 – 阿里通义推出的全模态理解与生成模型
4 天前
StaffDeck – 面壁智能等开源的企业级数字员工平台
4 天前
Nemotron 3 Embed – 英伟达开源的文本嵌入模型系列
4 天前
Inkling – Thinking Machines Lab 推出的多模态基础模型
5 天前
备果 – 360旗下推出的K12中小学教师 AI 备课平台
5 天前
X2.0 – Xmax AI 推出的全球首个实时交互视频生成模型
6 天前
Xiaomi-Robotics-U0 – 小米推出的统一具身合成模型
6 天前






