端到端 TTS 鼻祖,轻量可 CPU 跑
模型介绍
VITS 由 jaywalnut310(Jaehyeon Kim,KAKAO)于 2021 年 6 月提出并开源,论文是端到端神经 TTS 的里程碑。用变分自编码器 + 规范化流 + 对抗训练把文本直接映射为波形,无需中间谱,训练推理都简洁。约 83M 参数、不足 2GB 显存,CPU 也能实时合成,是轻量部署经典。同时是 GPT-SoVITS 等众多开源 TTS 声学模型的架构源头,MIT 许可、可商用。
模型基本信息
开发机构jaywalnut310(Jaehyeon Kim,KAKAO)
模型版本VITS(论文版)
参数规模约83M
模型类型文本转语音(TTS,端到端)
许可证MIT
上下文长度单句文本合成,长文需分段
发布日期2021-06-11(论文 arXiv:2106.06103)
模型架构VAE(Text Encoder + Flow)+ HiFi-GAN 生成器/判别器,单阶段端到端
模型能力
中文能力中(可训练中英单说话人)
英文能力强
代码能力N/A
推理能力N/A
长文本能力弱(单句级)
视觉能力N/A
工具调用N/A
模型版本
VITS(LJSpeech 英文)约83MVITS(中文/多说话人社区重训)约83M(各变体)
模型获取
部署方式
transformerscoqui TTS
显存需求
VITS FP32不足2GB
VITS CPU0(内存约2GB)
硬件推荐
RTX 3060轻松实时,甚至无需独显
RTX 3090批量合成无压力
RTX 4090远超实时
RTX 5090远超实时
Mac纯 CPU 也能实时
推荐配置
入门任意 4GB 卡或 CPU 运行 VITS
进阶RTX 3060+ 批量合成有声内容
专业CPU 集群批量部署(成本极低)
为什么选择这个模型
- 端到端架构简洁,里程碑式工作
- ~83M 轻量,CPU 都能实时
- MIT 许可完全商用
- 开源衍生生态庞大(SoVITS 等)
模型优点
- 无需中间谱,一步到位
- 显存需求极低、推理快
- 训练代码干净,可自行微调
- 影响众多后续模型(GPT-SoVITS 等)
模型缺点
- 仅支持训练时的说话人
- 零样本人声克隆能力弱
- 情绪/韵律控制有限
- 发布较早,自然度低于新一代
适合场景
- 学习端到端 TTS 原理
- 轻量嵌入式/CPU 语音合成
- 单说话人低成本量产语音
- 研究二次开发基座
不适合场景
- 零样本语音克隆
- 多语种即时切换
- 高自然度情感语音
部署教程
vLLM
语音模型不走 vLLM。实际推理: git clone https://github.com/jaywalnut310/vits.git && pip install -r requirements.txt python -c " import torch, sys from models import SynthesizerTrn from utils import load_checkpoint, get_hparams_from_file # 加载训练好的 G-*.pth 与 config,对文本推理输出 wav " 更简单:用 coqui TTS 的 tts_models 预置 VITS 模型(pip install TTS)
智算工坊实验室
实测速度CPU 实时、GPU 远超实时
显存占用不足2GB
功耗集成显卡即可
不同 GPU 对比轻量级,无显存焦虑
常见问题 FAQ
VITS 还能直接用吗?
可以直接推理预训练英/中文单说话人模型,也适合做教学与二次开发;但新产品普遍用更新架构。
VITS 和 GPT-SoVITS 什么关系?
GPT-SoVITS 的 SoVITS 声学模型基于 VITS 的 VAE/Flow 思想改进,VITS 是其架构源头。
相关模型
相关硬件
数据来源
- https://github.com/jaywalnut310/vits
- https://arxiv.org/abs/2106.06103