6 秒克隆标杆,多语言少样本 TTS
模型介绍
XTTS 是 Coqui 的多语言零样本语音合成模型,XTTS-v2 于 2023 年 10 月开源。基于 Tortoise 架构:443M 的 GPT-2 自回归模型预测 VQ-VAE 音频代码,Conditioning Encoder 从约 6 秒参考音频提取音色,经 HiFi-GAN 还原波形。6 秒参考即可克隆音色,支持 16+ 种语言含中文及跨语言合成,约 480M 参数、消费级显卡即可实时。授权 CPML 非商用,Coqui 关停后社区继续维护。
模型基本信息
开发机构Coqui(社区延续维护)
模型版本XTTS-v2(v2.0.2/2.0.3)
参数规模约480M(GPT 443M + HiFi-GAN 26M + VQ-VAE 13M)
模型类型文本转语音(TTS)/ 零样本语音克隆
许可证Coqui Public Model License(CPML,非商用)
上下文长度参考音频 6 秒起,长文分批生成
发布日期2023-10-31(HF 仓库)
模型架构GPT-2 自回归(文本→VQ 代码)+ Conditioning Encoder + HiFi-GAN(24kHz)
模型能力
中文能力强
英文能力强
代码能力N/A
推理能力N/A
长文本能力中(分批生成)
视觉能力N/A
工具调用N/A
模型版本
XTTS-v2约480MXTTS-v1较早版本
模型获取
部署方式
transformerscoqui TTSXinference
显存需求
XTTS-v2 FP32约4-6GB
XTTS-v2 FP16约3-4GB
硬件推荐
RTX 3060FP16 约3-4GB,实时合成
RTX 3090流畅克隆与更长音频
RTX 4090接近即时合成
RTX 5090更高并发
MacM 系列可跑,速度可接受
推荐配置
入门RTX 3060 12G + XTTS-v2 FP16(约4GB)
进阶RTX 4090 + XTTS-v2,实时批量合成
专业RTX 4090/5090 + 多实例 API 批量克隆服务
为什么选择这个模型
- 6 秒参考音频即克隆,门槛极低
- 多语种与跨语言克隆成熟
- Coqui 库集成好,部署简单
- 社区贡献历经多年验证,稳定
模型优点
- 零样本克隆仅需 6 秒音频
- 16+ 语言支持含中文
- 可跨语言合成(音色不随语言变化)
- 消费级显卡实时合成
- 可极少量数据微调提升相似度
模型缺点
- CPML 非商用授权
- Coqui 公司关停,长期维护存疑
- 英文质量最强,中文略弱于中文专精模型
- 长文本需分批拼接
适合场景
- 个性化配音与视频旁白
- 多语言内容本地化朗读
- 研究与教学演示
- 个人/内部非商用克隆
不适合场景
- 商用产品(需授权)
- 高阶情绪与歌唱合成
- 极高相似度克隆(建议微调)
部署教程
vLLM
语音模型不走 vLLM。实际推理:
pip install TTS
from TTS.api import TTS
tts = TTS("tts_models/multilingual/multi-dataset/xtts_v2", gpu=True)
tts.tts_to_file(text="你好世界", speaker_wav="ref.wav", language="zh", file_path="out.wav")智算工坊实验室
实测速度4090 上接近实时;3060 约 1-2x 实时
显存占用约4-6GB(FP32)/ 3-4GB(FP16)
功耗整机约 200-300W
不同 GPU 对比3060 已够用,4090 可批量
常见问题 FAQ
XTTS 可以商用吗?
官方权重是 CPML 非商用许可。有商用需求需评估授权,或改用 Apache-2.0 的 CosyVoice2 等替代。
参考音频要求高吗?
6 秒以上、干净无噪、20.05kHz 左右的人声即可克隆;参考音频越清晰,音色相似度越高。
相关模型
相关硬件
数据来源
- https://huggingface.co/coqui/XTTS-v2
- https://github.com/coqui-ai/TTS
- https://docs.coqui.ai/en/stable/models/xtts.html