热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >位列 Artificial Analysis 榜首,阿里千问发布语音合成大模型 Qwen-Audio-3.0-TTS

位列 Artificial Analysis 榜首,阿里千问发布语音合成大模型 Qwen-Audio-3.0-TTS

来源:互联网 更新时间:2026-07-20 20:54

阿里千问于 7 月 20 日正式发布语音合成大模型

Qwen-Audio-3.0-TTS

,包含两个版本:面向实时交互的 Flash 版本(首包延时 300ms 级别)和面向高质量生成的 Plus 版本。新模型在细粒度标签控制、freestyle 指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面实现系统性提升,让合成语音从“能说话”走向“会表达”。

核心特性一览

  • 细粒度标签控制

    :支持在文本中嵌入结构化标签,直接调控语气、情绪和呼吸细节。
  • Freestyle 指令遵循

    :无需严格格式,自然语言指令即可驱动语音风格变化。
  • 多语种与方言覆盖

    :支持 16 种语言和 20 种方言,满足全球化需求。
  • 复杂声学鲁棒性

    :在嘈杂环境、变声场景下仍保持稳定表现。

全球权威榜单夺冠

在全球第三方权威榜单

Artificial Analysis

中,Qwen-Audio-3.0-TTS-Plus 斩获冠军,综合性能获得国际认可。

结构化标签控制:精准表达情绪与语气

用户可直接在文本中嵌入以下标签,实现对语音的精细调控:

  • [gasp](抽气)
  • [giggles](轻笑)
  • [angry](愤怒)
  • 更多情绪类标记(如 [sigh][whisper] 等)

这些标签让语音合成不再只是“读文字”,而是能根据场景传递真实情感。

精品音色库:开箱即用的高品质资源

模型配套 精品音色库,将多语种、多方言、指令控制和细粒度表达的能力沉淀为可直接调用的音色资源。后续将陆续上架:

  • 指令风格音色

    :根据指令动态调整风格
  • 20 种方言音色

    :覆盖广东、重庆、东北、陕西、上海、四川、云南等
  • 细粒度控制音色

    :支持更细腻的情感表达
  • 14+ 小语种音色

音频输出规格从 24KHz 提升至 48KHz,相当于从电话和普通语音助手的品质提升到录音棚、影视配音的规格。单次语音合成最长可达 3 分钟

多语种与方言覆盖详情

面向全球多语种场景,Qwen-Audio-3.0-TTS-Plus 进行了专项优化,覆盖以下语言:

  • 16 种语言

    :中文、英文、日文、韩文、德文等,并新增阿拉伯、越南、马来、菲律宾语。
  • 20 种方言

    :广东、重庆、东北、陕西、上海、四川、云南等。

用户可根据实际场景选择原声或特定方言,无需额外训练。

开放链接与使用入口

Qwen-Audio-3.0-TTS 现已全面开放,可通过以下链接体验:

小提示

  • 如果对实时性要求高(如语音助手、直播交互),建议优先选择

    Flash 版本

    ,首包延时仅 300ms 级别。
  • 如果追求最高音质与情感表现力(如有声书、影视配音),建议使用

    Plus 版本

    ,支持 48KHz 采样率和 3 分钟长文本。
  • 使用结构化标签时,请确保标签拼写正确(如 [giggles] 而非 [giggle]),否则可能被忽略。

常见问题

Q:Flash 和 Plus 版本的主要区别是什么?


A:Flash 版本优先保证低延迟(首包延时 300ms),适合实时交互场景;Plus 版本优先保证高音质(48KHz 采样率)和长文本合成(最长 3 分钟),适合内容创作场景。

Q:如何调用结构化标签?


A:在输入文本中直接嵌入标签即可,例如:“你今天怎么样?[giggles] 我很好。”模型会自动识别并应用对应语气。

Q:支持哪些方言?


A:目前支持 20 种方言,包括广东、重庆、东北、陕西、上海、四川、云南等,后续会持续扩充。

热门手游

相关攻略

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc