数据点
小红书 dots 团队和上海交大 X-LANCE 实验室联合开源了 dots.tts:一个 20 亿参数、全连续、端到端的自回归语音合成基础模型。它在 Seed-TTS-Eval 的中文、英文、中文困难集三个子集上拿到平均 WER/CER 2.95%、平均 SIM 79.2——同时拿下最佳平均音色相似度和最佳平均内容准确度(SOTA 双榜)。在 MiniMax-Speech 的 24 语种测试中,dots.tts 自纠正对齐版本的平均说话人相似度达到 83.9,24 种语言里有 19 个语种拿到单项 SIM 第一。
工程上这次开源给得很彻底:预训练、自纠正对齐、MeanFlow 四步 / 两步 / 单步,加上 1T1A 双流一共六个检查点;训练、推理、微调、蒸馏代码全部释出;许可证是 Apache 2.0。推理侧 SGLang-Omni 团队已经原生支持 dots.tts,在 Seed-TTS-Eval EN 测试集上单卡最高跑 16 路并行。
它解决了什么
语音合成这条赛道当前的底层路线远没有收敛。一派走非自回归扩散(适合离线,但实时性差);一派把语音压成离散 Token 再走自回归预测(沿用大语言模型的范式,但因为语音天然连续,离散量化在音色气声/鼻音/语速变化这些维度上有不可消除的信息瓶颈)。dots.tts 的选择是直接在 48 kHz 的 AudioVAE 连续隐空间中以自回归方式逐块建模——跳过离散 Token、跳过量化损失。
重建评测把这两种路线之间的差距直接量化出来:四种主流离散表征的 PESQ-NB 在 2.40–2.92 之间,SIM 在 0.68–0.85 之间;dots.tts VAE 在 LibriSpeech test-other 上 PESQ-NB 达到 4.09、SIM 0.969、STOI 0.973、WER 4.14%。这套表征被命名为 HoliTok——在第二阶段语义化训练中加入了 WavLM 帧级表征对齐以及 ASR / 情绪 / 说话人识别多任务监督,让连续隐空间既有清晰的语义结构,又能保留高保真声学细节。
真正难的部分是「连续自回归」的误差累积问题。连续隐变量没有离散码本的量化兜底,前一步微小偏差会进入下一步历史,并在逐块生成中向后传播——句子一长就容易出现啸叫、音色漂移或文本错位。dots.tts 用两段架构来压这个噪声:把 AudioVAE 的语义化编码器直接复用为因果 Semantic Encoder,让每生成一段新语音都能提取稳定语义历史回灌给后续步骤。这套架构让同模型同时训练 ASR 和 TTS 时,无需额外优化技巧就能稳定完成统一建模——同时服务语音理解和生成这件事第一次有了可工业化的方案。
它改变了什么
发布这次开源之前,主流看法是「自回归 TTS 在长文本上会漂移」「声音细节保留不住」。dots.tts 把这两件事一次性解决了,但更重要的是把推理侧的工程指标拉到实时语音 Agent 可以直接接管的水平:
– 1T1A 双流模式音频首包延迟低至 54.4 ms – 完整文本作为前缀输入,模型逐块生成音频块,天然支持流式 – SGLang-Omni 引擎单卡 16 路并行
这意味着实时语音 Agent、双工对话系统、低延迟播报场景,第一次有了「同时具备 SOTA 音色 + SOTA 内容准确度 + 单卡 16 路 + 54ms 首包」的基座模型可选。在这个时间点发出来,时间窗也很微妙——Agent 已经开始处理「一小时以上的工作」(OpenAI 披露 5 月超 70% Codex 用户在做这件事),实时语音交互是 Agent 走向多模态执行的下一个必经通道。
下一步值得关注:MeanFlow 压缩到单步生成时质量明显下降,团队引入简化一致性模型(sCM)和 Reward-Aware DMD 来拉稳 1-2 步生成的可用性;这套链路同样开源——意味着下游开发者可以用它训练自己的低步数 TTS 蒸馏。开源同周,cosy voice / F5-TTS / VoxCPM / GPT-SoVITS / IndexTTS 这些主流方案在 Apple Silicon + 大显存的统一内存架构下都有了真实可跑的版本——TTS 基础模型「开源可用」这条赛道的拥挤度,比三个月前密了一档。
参考来源:小红书技术公众号 dots.llm、机器之心
