AI资讯ai-models
打造可持续扩展的 TTS 基座
核心亮点
小红书 dots 团队开源了 dots.tts,一个 20 亿参数、全连续、端到端自回归的语音合成模型。说白了,它不是传统"拼接式"或"分段式"TTS,而是从文本直接连续地生成语音表征,整体更像一个大模型在"说话"。在 Seed-TTS-Eval 三个子集上,它拿下了平均内容准确度和平均说话人相似度的最佳成绩。
具体能力或事件经过
dots.tts 的关键词是"全连续"与"端到端自回归"。传统 TTS 常把语音切成离散单元再拼,容易出现断点、节奏生硬。dots.tts 用连续表征贯穿始终,让音色和韵律更自然。团队把它定位为"可持续扩展的 TTS 基座",意味着这个底座可以像语言模型一样不断加数据、加参数往上堆,而不必推倒架构。
技术细节
20 亿参数在语音模型里属于偏大的体量,足以刻画细腻的韵律与音色。自回归结构让模型逐帧生成,天然适合长文本与稳定节奏。Seed-TTS-Eval 是业内公认的 TTS 评测基准,dots.tts 在内容准确度(读得对)和说话人相似度(像那个人)两个维度同时登顶,说明它在"准"和"像"之间取得了平衡,而不是只优化一边。
与竞品对比
对比 CosyVoice、Fish Speech 等开源 TTS,dots.tts 强调"全连续"带来的自然度优势,以及"基座可扩展"的工程取向。简单来说,很多开源方案在单说话人或短句上表现不错,但 dots.tts 想解决的是大规模、多说话人、可持续训练的生产级需求,更像是为工业部署准备的底座。
行业影响或适用场景
对有声书、虚拟主播、客服语音、短视频配音等内容生产方,dots.tts 提供了一个高质量且可自托管的选项。开源意味着数据隐私可控、成本可控。它代表了一个方向:语音合成正在从"功能模块"升级为"可成长的基础模型",谁先把底座做扎实,谁就掌握下一代语音应用的入口。