VITS

★★★★★ 4.2 分

经典端到端 TTS 里程碑,单模型合成自然语音,是众多二次元声库与语音助手的底层引擎。

语音合成开源经典端到端
参数量VITS(约 0.1~0.2B,各语言单模型)
模型类型端到端 TTS(VAE+GAN+流)
许可证MIT
开发者LINE / 学术社区
★★★★★ 4.5

端到端 TTS 鼻祖,轻量可 CPU 跑

语音合成端到端轻量开源

模型介绍

VITS 由 jaywalnut310(Jaehyeon Kim,KAKAO)于 2021 年 6 月提出并开源,论文是端到端神经 TTS 的里程碑。用变分自编码器 + 规范化流 + 对抗训练把文本直接映射为波形,无需中间谱,训练推理都简洁。约 83M 参数、不足 2GB 显存,CPU 也能实时合成,是轻量部署经典。同时是 GPT-SoVITS 等众多开源 TTS 声学模型的架构源头,MIT 许可、可商用。

模型基本信息

开发机构jaywalnut310(Jaehyeon Kim,KAKAO)
模型版本VITS(论文版)
参数规模约83M
模型类型文本转语音(TTS,端到端)
许可证MIT
上下文长度单句文本合成,长文需分段
发布日期2021-06-11(论文 arXiv:2106.06103)
模型架构VAE(Text Encoder + Flow)+ HiFi-GAN 生成器/判别器,单阶段端到端

模型能力

中文能力中(可训练中英单说话人)
英文能力强
代码能力N/A
推理能力N/A
长文本能力弱(单句级)
视觉能力N/A
工具调用N/A

模型版本

VITS(LJSpeech 英文)约83MVITS(中文/多说话人社区重训)约83M(各变体)

模型获取

部署方式

transformerscoqui TTS

显存需求

VITS FP32不足2GB
VITS CPU0(内存约2GB)

硬件推荐

RTX 3060轻松实时,甚至无需独显
RTX 3090批量合成无压力
RTX 4090远超实时
RTX 5090远超实时
Mac纯 CPU 也能实时

推荐配置

入门任意 4GB 卡或 CPU 运行 VITS
进阶RTX 3060+ 批量合成有声内容
专业CPU 集群批量部署(成本极低)

为什么选择这个模型

  • 端到端架构简洁,里程碑式工作
  • ~83M 轻量,CPU 都能实时
  • MIT 许可完全商用
  • 开源衍生生态庞大(SoVITS 等)

模型优点

  • 无需中间谱,一步到位
  • 显存需求极低、推理快
  • 训练代码干净,可自行微调
  • 影响众多后续模型(GPT-SoVITS 等)

模型缺点

  • 仅支持训练时的说话人
  • 零样本人声克隆能力弱
  • 情绪/韵律控制有限
  • 发布较早,自然度低于新一代

适合场景

  • 学习端到端 TTS 原理
  • 轻量嵌入式/CPU 语音合成
  • 单说话人低成本量产语音
  • 研究二次开发基座

不适合场景

  • 零样本语音克隆
  • 多语种即时切换
  • 高自然度情感语音

部署教程

vLLM
语音模型不走 vLLM。实际推理:
git clone https://github.com/jaywalnut310/vits.git && pip install -r requirements.txt
python -c "
import torch, sys
from models import SynthesizerTrn
from utils import load_checkpoint, get_hparams_from_file
# 加载训练好的 G-*.pth 与 config,对文本推理输出 wav
"
更简单:用 coqui TTS 的 tts_models 预置 VITS 模型(pip install TTS)

智算工坊实验室

实测速度CPU 实时、GPU 远超实时
显存占用不足2GB
功耗集成显卡即可
不同 GPU 对比轻量级,无显存焦虑

常见问题 FAQ

VITS 还能直接用吗?

可以直接推理预训练英/中文单说话人模型,也适合做教学与二次开发;但新产品普遍用更新架构。

VITS 和 GPT-SoVITS 什么关系?

GPT-SoVITS 的 SoVITS 声学模型基于 VITS 的 VAE/Flow 思想改进,VITS 是其架构源头。

相关模型

相关硬件

数据来源

  • https://github.com/jaywalnut310/vits
  • https://arxiv.org/abs/2106.06103