标签

阿里发布Qwen-Audio-3.0-TTS:Plus登顶全球榜首

发布时间:2026-07-21 01:45阅读:2

7月20日晚间,阿里巴巴推出了新一代语音合成大模型Qwen-Audio-3.0-TTS。该模型在细粒度标签控制、自由风格指令遵循、多语言及方言支持以及复杂声学鲁棒性上实现了全面升级。产品线包含面向实时对话的Flash版(首包响应时间约300毫秒)和追求极致音质的Plus版,标志着合成语音从单纯的“发声”进化为具备情感的“表达”。据悉,Qwen-Audio-3.0-TTS-Plus已登顶全球权威评测平台Artificial Analysis的冠军宝座。

基于前代模型对freestyle(自由风格)的支持,新版本允许用户在提示词中定义“资深客服”或“足球解说员”等角色,以调节情绪、场景和语速。此次升级进一步提升了细粒度控制能力,引入了[gasp](吸气)、[giggles](轻笑)等结构化标签,用户可在文本中精准插入这些标记。这种控制粒度已细化至单字级别的情绪控制,非常适合叙事、游戏和配音等对细节要求极高的场景。

针对全球化应用,Qwen-Audio-3.0-TTS进行了针对性的优化,支持包括中文、英文、日文、韩文、德文在内的16种语言,并新增了阿拉伯语、越南语、马来语和菲律宾语。

为解决大模型在混合数据训练下容易“普通话化”的难题,研发团队实施了方言强化训练。这使得模型在韵律、声调及口语表达上更贴近母语者水平,目前已覆盖广东、重庆、东北、陕西、上海、四川、云南等20种方言。

不同于传统语音克隆对录音环境的苛刻要求,Qwen-Audio-3.0-TTS利用真实声学仿真技术,在克隆过程中内置了语音增强模块。即便在嘈杂或混响严重的环境中,模型也能精准提取音色。在专业创作领域,该模型提供了即用型的高品质音色库,并将音频采样率提升至48kHz,输出质量媲美录音棚或影视配音,单次合成时长最长可达3分钟。

目前,Flash和Plus两款模型均已上线阿里云百炼平台,支持调用。

编辑:孙同怀

新浪财经声明:本文转载自合作媒体,旨在传递更多信息,内容仅供参考,不构成投资建议。

郑重声明:1.根据《证券法》规定,禁止编造、传播虚假信息或者误导性信息;2.用户在本社区发表的所有资料、言论等仅代表个人观点,与本网站立场无关,不对您构成任何投资建议。