AI AI工具情报站
国内AI动态 ai-models

TTS,登顶TTS排行榜

📰 X:通义千问 / Qwen (@Alibaba_Qwen) 📅 2026-07-23

核心亮点

阿里通义千问推出最新文本转语音模型 Qwen-Audio-3.0-TTS,并一举登顶 Artificial Analysis TTS 排行榜。该模型提供 Flash(实时交互)和 Plus(高质量生成)两个版本,覆盖从低延迟对话到高保真有声内容的完整需求。简单来说,千问这次把“可控”和“好听”同时做到了开源阵营难以企及的水位,对外直接叫板国际一线 TTS 厂商。

具体能力或事件经过

新模型的能力亮点集中在细粒度控制。它支持内联标签控制,开发者可以在文本中直接插入【whisper】(耳语)、【angry】(愤怒)等情绪与形态标签,让同一段文字按指定语气发声。更实用的是自然语言风格控制:用户用一句“用温柔的老年女声读”,模型就能理解并执行,而不必钻研复杂的参数。官方表示,模型支持 16 种语言,且单次可生成最长 3 分钟的长音频,足以覆盖播客片段、有声书章节等真实生产场景。

技术细节

Flash 版本面向实时交互,强调低延迟与流式输出,适合智能体语音对话、实时字幕配音等场景;Plus 版本则追求高保真与自然度,面向有声内容制作。内联标签与自然语言风格控制并存,意味着既可以让工程师精确编排,也可以让普通用户用白话描述。多语言与长音频能力的结合,则降低了跨语种内容生产的门槛,对出海应用尤其友好。

与竞品对比

在 TTS 这个赛道,国际厂商长期在自然度与多语言上领先。Qwen-Audio-3.0-TTS 登顶 Artificial Analysis 排行榜,说明国产模型在主观听感与客观指标上已经具备正面竞争力。相比只提供“固定几个音色”的同类产品,它的细粒度标签加自然语言控制组合,给了内容生产者更大的表达自由度,也更贴合智能体需要“带情绪说话”的新需求。

行业影响或适用场景

说白了,TTS 正在从“把字念出来”升级为“像人一样演出来”。这款模型适合有声书、短视频配音、智能体语音交互、客服播报等场景,尤其是需要批量、稳定、可控输出的团队。随着智能体成为入口,能自然表达情绪的语音能力会变得像文本生成一样基础,而登顶排行榜也为后续商业化与生态接入打开了空间。