登录

连续自回归的dots.tts:小红书开源语音合成模型「基座」


速读:提着獭犸的喇嘛要拿獭犸换别着喇叭的哑巴的喇叭; 别着喇叭的哑巴不愿拿喇叭换提着獭犸的喇嘛的獭犸。 自回归是dots.。
2026年08月13日 10:

机器之心发布

语音合成这条赛道,最近越来越像早期的大语言模型:模型一个比一个强大,底层路线却远没有收敛。

有人选择非自回归的扩散,一次并行生成整段声音,但是这种方法只适合离线使用;

有人沿用大语言模型最熟悉的方式,把语音压成离散 Token,再逐个自回归预测,但是语音毕竟不是一个一个的词,这样的做法会有一个无法打破的天花板。

小红书 dots 团队和上海交通大学 X-LANCE 实验室这次合作开源的  dots.tts ,走的是另一条路线: 不用离散 token,而是在连续隐空间中进行自回归生成 。

它是一个 20 亿参数、全连续、端到端的自回归 TTS 基础模型。整条生成链路不依赖离散声学 Token:模型直接在连续隐空间中,以自回归方式逐个声学块建模,再把连续隐变量还原成波形。

最稳最像 :Seed-TTS-Eval 三个子集上,平均准确度和平均说话人相似度达到 SOTA;

可扩展基座 :支持音色微调、任务微调,例如 dots.tts.edit 就直接沿用 dots.tts 基座模型,支持文本、情绪、韵律和停顿四类编辑,指令执行率和局部保持率在 doteBench 上整体领先;

全量开源 :预训练、自纠正对齐、MeanFlow 四步、两步和单步,以及 1T1A 双流共六个检查点;同时开放训练、推理、微调、蒸馏代码,采用 Apache 2.0 许可;

交互优先 :天然支持流式输出,配合双工对话系统还可以使用 1T1A 的双流模式;

推理友好 :1T1A 双流模式音频首包低至 54.4 毫秒;使用 SGLang Omni 引擎最高支持 16 路并行推理;

先看模型表现

Seed-TTS-Eval 是语音生成领域常见的零样本声音克隆评测。模型只拿到一小段训练时未见过的参考语音,再用同一个人的声音说出新文本。

它主要测试两件事:

第一,准确度 :即内容有没有说对。英语用 WER,中文用 CER,数值越低越好。

第二,相似度 :即声音像不像同一个人。SIM 衡量生成音频和参考音频在说话人表征上的相似度,数值越高越好。

dots.tts SOAR 版本在中文、英文和中文困难集上的 WER/CER 分别为  0.94%、1.30% 和 6.60% ,SIM 分别为  81.0、77.1 和 79.5 。

把三个子集取平均后,它的平均 SIM 为  79.2 ,平均 WER/CER 为  2.95% ;dots.tts 拿到了最佳平均音色相似度和最佳平均内容准确度。

图 1|Seed-TTS-Eval 上的平均 WER 与平均 SIM 分布。横轴越靠左内容越准,纵轴越靠上音色越像,dots.tts 位于左上角。

表 1|Seed-TTS-Eval 零样本克隆核心结果。约 3 秒参考音频,由评测集自带的 ASR 与 WavLM-SV 打分;基线取自各自论文或默认配置的开源版本。

在 MiniMax-Speech 的 24 语种测试中,dots.tts 自纠正对齐版本的平均说话人相似度达到  83.9 ,高于表中其他系统;dots.tts 的不同版本在 24 种语言中拿下 19 个语种的单项 SIM 第一,并在另外 2 个语种并列第一。

在偏表现力的 EmergentTTS-Eval 上,以 gpt-4o-mini-tts 为基准做两两对比,dots.tts SOAR 版本拿到表中最高的句法复杂度得分  65.7% ,高于所有闭源系统;dots.tts Base 版本则取得开源系统中最好的情绪表现力得分  72.7% 。

图 2|EmergentTTS-Eval 总体胜率对比。红色为 dots.tts,紫色为闭源系统,蓝色为开源系统,虚线为 50% 基准线。

下面几个音频取自这几个测试集

seed-tts-eval 困难文本

参考音频: 「 由于对球没有很好的控制力,我通常打直球。 」

生成音频: 「 喇嘛与哑巴 打南边来了个哑巴,腰里别了个喇叭;打北边来了个喇嘛,手里提了个獭犸。提着獭犸的喇嘛要拿獭犸换别着喇叭的哑巴的喇叭;别着喇叭的哑巴不愿拿喇叭换提着獭犸的喇嘛的獭犸。不知是别着喇叭的哑巴打了提着獭犸的喇嘛一喇叭;还是提着獭犸的喇嘛打了别着喇叭的哑巴一獭犸。喇嘛回家炖獭犸;哑巴嘀嘀哒哒吹喇叭 」

多语言克隆西班牙语

参考音频: 「 El Instituto Acton, un Tintag libertario conservador cristiano estadounidense, lleva su nombre. 」

生成音频: 「 Mi padre suspiró, amparado en aquella sonrisa triste que le perseguía como una sombra por la vida. 」

跨语言克隆英文 - 中文

参考音频: 「 Which is what has brought us to this point in the first place. 」

生成音频: 「 那我来给大家推荐一款 T 恤,这款呢真的是超级好看,这个颜色呢很显气质,而且呢也是搭配的绝佳单品,大家可以闭眼入,真的是非常好看,对身材的包容性也很好,不管啥身材的宝宝呢,穿上去都是很好看的。推荐宝宝们下单哦。 」

语言表现力

参考音频: 「 没必要和那些大师的作品比较吧。 」

生成音频: 「 哎呀你得知道啊,要把知识硬塞到那些学生的脑瓜子里去,啧啧,说真的,实在是件乏味得要死的苦差事,你说是不是嘛。不过呢,要是偶尔能遇上个心有灵犀的聪明孩子,哎嘿,你只要稍微点拨一下下,他就能豁然贯通了,哇,真的太神奇了。嘿嘿嘿,我跟你讲,这时候呀,这世上绝对再没有比教书更让人心仪的事情了,哈哈哈哈,你说对吧? 」

音色克隆,其实是自回归 TTS 基模最自然的一场考试

我们为什么主要用音色克隆的方式来评价 TTS 模型呢?其实音色克隆是自回归 TTS 基模的 一场基础能力的考试 。

自回归是 dots.tts 的第一个核心方向选择。这也是今天文本大模型的生成方式。文本大模型靠预测下一个 Token 学习语言,TTS 大模型则在目标文本、参考音频和已经生成的声学历史的条件下,预测下一个声音片段,再把刚生成的片段加入历史,继续向后生成。

对语音模型来说,几秒参考音频就像一段 “声音提示词”。里面包含这个人的音色、语速、音高走势、停连和韵律。模型结合另一段新文本,一步步预测 “这个人接下来会怎样把这句话说出来”,最终得到的,恰好就是这个声音在新内容上的延续。

这也解释了 zero-shot 的克隆能力为什么重要。它表面上在考 “给几秒声音,能不能克隆”,实际上同时检查了 TTS 基模的几项基本功:是否理解参考音频,是否准确说出新文本,是否在逐步生成中保持说话人身份和韵律,以及面对困难文本时是否仍然稳定。

所以,dots.tts 在三个子集上拿到最低平均 WER/CER 和最高平均 SIM,说明它具备了很强的未来预测能力的基础能力:内容说得准,声音保持得住,逐步生成也足够稳定。

连续表示,把音色里容易被量化抹掉的细节留下来

再看 dots.tts 的另一个核心选择方向: 直接在连续隐空间中建模声音 ,跳过离散 Token 量化。

声音天然是连续的。一个人的身份分布在频谱质感、气声与鼻音、音高的细微起伏、音节时长、停顿方式和语速变化等大量细节中。这些特征共同构成了 “这个人究竟是怎样说话的”。

离散表示会把连续变化映射到有限词表中的编号,训练和推理可以沿用语言模型成熟的 Token 预测范式。量化也会形成信息瓶颈:不同的声音细节可能落入同一个编号,编码时丢失的信息很难由后续模型重新恢复。

重建评测把这种差距直接呈现了出来。四种离散表征的 PESQ-NB 为  2.40—2.92 ,SIM 为  0.68—0.85 ;三种主要连续表征的 PESQ-NB 达到  3.99、4.23 和 4.09 ,SIM 达到  0.963、0.950 和 0.969 。在 PESQ、STOI、SIM 和重建后的 WER 上,连续表征整体拉开了明显差距。

其中,SIM 的差别尤其直观。离散方案的最高值为  0.85 ,dots.tts VAE 达到  0.969 。这组指标衡量语音经过编码和解码后,说话人身份还能保留多少。隐空间上重建的表现就是自回归模型能够达到的上限。

这里 MingTok-Audio 使用更密的  50 Hz  潜变量序列,在 PESQ 和 STOI 上取得最高结果。这也证明了信息量更大的连续表征,可以获得更强的上限。

dots.tts VAE 面向 48 kHz 语音,将连续序列压缩到  25 FPS ,仍取得  4.09/3.95 的 PESQ、0.973 的 STOI、0.969 的 SIM 和 4.14% 的 WER ,在声音信息和自回归序列长度之间取得了平衡。

主题:自回归|连续|大语言模型