Tortoise-TTS

★★★★★ 4.1 分

老牌高质量 TTS,音色克隆自然、支持语音风格调节,是研究 TTS 的上好开源样本。

语音合成克隆开源高质量
参数量Tortoise-TTS(约 0.5B)
模型类型高质量自回归 TTS(音色克隆)
许可证Apache 2.0
开发者James Betker / 社区
★★★★★ 4.3

高保真克隆经典,速度是硬伤

语音合成零样本克隆开源

模型介绍

Tortoise-TTS 由 James Betker(neonbjb)2022 年开源,是早期零样本语音克隆代表作。五子模型级联:420M 自回归解码器把文本转音频 token,扩散解码器(292M)重建梅尔谱,CLVP(67M)对候选重排序,声码器还原波形。给 2-4 句参考音频即可克隆,英文音色自然有情感。全管线约 960M 参数、需约 4-6GB 显存,质量高但推理很慢,fp16+kv-cache 后 4GB 卡约 0.25-0.3 RTF。Apache-2.0 许可。

模型基本信息

开发机构James Betker(neonbjb,前 Coqui)
模型版本Tortoise-TTS v2
参数规模全管线约960M(自回归420M + 扩散292M + CLVP67M + 声码器等)
模型类型文本转语音(TTS)/ 零样本少样本克隆
许可证Apache-2.0
上下文长度文本 token 受限,长文分段
发布日期2022-04-18(HF 仓库)
模型架构自回归(GPT-2)+ 扩散解码器 + CLVP 重排序 + 声码器,22.05/24kHz

模型能力

中文能力弱(主要面向英文)
英文能力很强
代码能力N/A
推理能力N/A
长文本能力弱(单句级)
视觉能力N/A
工具调用N/A

模型版本

Tortoise-TTS v2约960M

模型获取

部署方式

transformerscoqui TTS

显存需求

v2 full FP16约4-6GB
v2 低占用模式可低至约4GB(fp16+KV cache)

硬件推荐

RTX 3060fp16 可跑,但速度慢
RTX 3090提速明显,RTF≈0.3
RTX 4090大幅提速,仍在秒级
RTX 5090更快但仍是串行级联
MacM 系可跑,慢

推荐配置

入门RTX 3060 12G + fp16(约4GB)
进阶RTX 3090/4090 + fp16 + kv-cache,RTF≈0.25-0.3
专业RTX 4090 + 批量预生成(质量优先 Slow 场景)

为什么选择这个模型

  • 英文高质量零样本克隆经典
  • 5 个子模型管线思路启发后辈
  • Apache-2.0 完全开源
  • 对后续 XTTS 等影响深远

模型优点

  • 英文克隆音色保真度高
  • 少样本(2-4 句)即可用
  • 候选重排序提升稳定性
  • 许可宽松、社区资料多

模型缺点

  • 推理极慢(AR+扩散级联)
  • 中文支持差
  • 需较多参考语音才有最佳效果
  • 长文本需多次拼接
  • 生态停留在 2022 年水平

适合场景

  • 英文高保真少样本克隆
  • 学习零样本 TTS 架构原理
  • 效果优先、不赶速度的离线合成

不适合场景

  • 中文语音合成
  • 实时/流式应用
  • 低功耗批量生产

部署教程

vLLM
语音模型不走 vLLM。实际推理:
git clone https://github.com/neonbjb/tortoise-tts.git && pip install -r requirements.txt
python -c "
from tortoise.api import TextToSpeech
from tortoise.utils.audio import load_audio
api = TextToSpeech(half=True)
ref = load_audio('ref.wav', 22050)
# 取 2-4 个 6-10s 片段
out = api.tts_with_preset('Hello world', voice_samples=[ref], preset='fast')
"
预设:ultra_fast 最快,high_quality 最慢但最佳

智算工坊实验室

实测速度fp16 4GB 卡约 0.25-0.3 RTF;CPU 每句需数分钟
显存占用约4-6GB(FP16)
功耗整机约 200-300W
不同 GPU 对比质量固定,速度随 GPU 线性提升;不适合实时

常见问题 FAQ

Tortoise 为什么这么慢?

先生成大量候选 token(自回归)再做扩散重建,并由 CLVP 挑选,串行且计算量大;用 fast/ultra_fast 预设并开 fp16、kv-cache 可缓解。

用作中文语音可行吗?

不推荐。Tortoise 主要为英文训练,中文会发音不准;中文场景建议 CosyVoice2、GPT-SoVITS 或 F5-TTS。

相关模型

相关硬件

数据来源

  • https://huggingface.co/jbetker/tortoise-tts-v2
  • https://github.com/neonbjb/tortoise-tts
  • https://nonint.com/2022/04/25/tortoise-architectural-design-doc/