XTTS

★★★★★ 4.4 分

Coqui 开源的跨语言语音克隆,一段音频即可克隆音色并用其他语言朗读,多语言场景首选。

语音合成克隆音色开源多语言
参数量XTTS v2(约 0.8B)
模型类型语音克隆 TTS(跨语言)
许可证Coqui 公共模型许可
开发者Coqui AI
★★★★★ 4.7

6 秒克隆标杆,多语言少样本 TTS

语音合成语音克隆多语言

模型介绍

XTTS 是 Coqui 的多语言零样本语音合成模型,XTTS-v2 于 2023 年 10 月开源。基于 Tortoise 架构:443M 的 GPT-2 自回归模型预测 VQ-VAE 音频代码,Conditioning Encoder 从约 6 秒参考音频提取音色,经 HiFi-GAN 还原波形。6 秒参考即可克隆音色,支持 16+ 种语言含中文及跨语言合成,约 480M 参数、消费级显卡即可实时。授权 CPML 非商用,Coqui 关停后社区继续维护。

模型基本信息

开发机构Coqui(社区延续维护)
模型版本XTTS-v2(v2.0.2/2.0.3)
参数规模约480M(GPT 443M + HiFi-GAN 26M + VQ-VAE 13M)
模型类型文本转语音(TTS)/ 零样本语音克隆
许可证Coqui Public Model License(CPML,非商用)
上下文长度参考音频 6 秒起,长文分批生成
发布日期2023-10-31(HF 仓库)
模型架构GPT-2 自回归(文本→VQ 代码)+ Conditioning Encoder + HiFi-GAN(24kHz)

模型能力

中文能力强
英文能力强
代码能力N/A
推理能力N/A
长文本能力中(分批生成)
视觉能力N/A
工具调用N/A

模型版本

XTTS-v2约480MXTTS-v1较早版本

模型获取

部署方式

transformerscoqui TTSXinference

显存需求

XTTS-v2 FP32约4-6GB
XTTS-v2 FP16约3-4GB

硬件推荐

RTX 3060FP16 约3-4GB,实时合成
RTX 3090流畅克隆与更长音频
RTX 4090接近即时合成
RTX 5090更高并发
MacM 系列可跑,速度可接受

推荐配置

入门RTX 3060 12G + XTTS-v2 FP16(约4GB)
进阶RTX 4090 + XTTS-v2,实时批量合成
专业RTX 4090/5090 + 多实例 API 批量克隆服务

为什么选择这个模型

  • 6 秒参考音频即克隆,门槛极低
  • 多语种与跨语言克隆成熟
  • Coqui 库集成好,部署简单
  • 社区贡献历经多年验证,稳定

模型优点

  • 零样本克隆仅需 6 秒音频
  • 16+ 语言支持含中文
  • 可跨语言合成(音色不随语言变化)
  • 消费级显卡实时合成
  • 可极少量数据微调提升相似度

模型缺点

  • CPML 非商用授权
  • Coqui 公司关停,长期维护存疑
  • 英文质量最强,中文略弱于中文专精模型
  • 长文本需分批拼接

适合场景

  • 个性化配音与视频旁白
  • 多语言内容本地化朗读
  • 研究与教学演示
  • 个人/内部非商用克隆

不适合场景

  • 商用产品(需授权)
  • 高阶情绪与歌唱合成
  • 极高相似度克隆(建议微调)

部署教程

vLLM
语音模型不走 vLLM。实际推理:
pip install TTS
from TTS.api import TTS
tts = TTS("tts_models/multilingual/multi-dataset/xtts_v2", gpu=True)
tts.tts_to_file(text="你好世界", speaker_wav="ref.wav", language="zh", file_path="out.wav")

智算工坊实验室

实测速度4090 上接近实时;3060 约 1-2x 实时
显存占用约4-6GB(FP32)/ 3-4GB(FP16)
功耗整机约 200-300W
不同 GPU 对比3060 已够用,4090 可批量

常见问题 FAQ

XTTS 可以商用吗?

官方权重是 CPML 非商用许可。有商用需求需评估授权,或改用 Apache-2.0 的 CosyVoice2 等替代。

参考音频要求高吗?

6 秒以上、干净无噪、20.05kHz 左右的人声即可克隆;参考音频越清晰,音色相似度越高。

相关模型

相关硬件

数据来源

  • https://huggingface.co/coqui/XTTS-v2
  • https://github.com/coqui-ai/TTS
  • https://docs.coqui.ai/en/stable/models/xtts.html