GPT-SoVITS

★★★★★ 4.7 分

现象级中文语音克隆模型,零样本克隆音色、效果惊艳,是中文 TTS 克隆的事实标准。

语音合成克隆音色开源中文
参数量GPT-SoVITS(约 0.3B)
模型类型端到端语音克隆 TTS(Zero-shot)
许可证MIT
开发者GPT-SoVITS 开源社区
★★★★★ 4.8

1 分钟数据克隆专属音色,社区最火

语音合成语音克隆Few-shot开源

模型介绍

GPT-SoVITS 是社区(RVC-Boss)开源的强 few-shot 语音合成系统,2024 年 1 月发布。由 GPT(语义 token 自回归)+ SoVITS(VITS 变体声学模型)两级组成,仅需 1 分钟内目标音频即可微调专属音色,零样本模式给参考音频就能克隆,支持中日英韩粤及跨语种合成。v2/v4/v2ProPlus 多代底模持续迭代,带 Gradio WebUI,是中文语音克隆与配音圈最常用的开源方案(MIT)。

模型基本信息

开发机构RVC-Boss(社区)/ 作者「冰块」
模型版本GPT-SoVITS v2 底模(另有 v4 / v2ProPlus)
参数规模v2 90M+77M;v4 330M+77M;v2ProPlus 152M+77M
模型类型语音转换 + 文本转语音(TTS)/ few-shot 克隆
许可证MIT
上下文长度零样本克隆(参考音频)或微调说话人
发布日期2024-01-16(HF 仓库)
模型架构GPT(语义 token 自回归)+ SoVITS(VITS 变体声学模型),30kHz/48kHz

模型能力

中文能力很强
英文能力强
代码能力N/A
推理能力N/A
长文本能力中(长文逐段合成)
视觉能力N/A
工具调用N/A

模型版本

GPT-SoVITS v4330M+77MGPT-SoVITS v2ProPlus152M+77MGPT-SoVITS v290M+77MGPT-SoVITS v190M+77M

模型获取

部署方式

transformersgradio

显存需求

v2 推理约4GB
v4 推理约6-8GB
微调训练约8-14GB

硬件推荐

RTX 3060可跑 v2/v2Pro 推理,微调用 LoRA
RTX 3090v2ProPlus/v4 推理流畅
RTX 4090微调更快,实时合成
RTX 5090超实时批量合成
MacM 系可跑推理(速度慢)

推荐配置

入门RTX 3060 12G + v2 v2Pro 底模(约4GB)
进阶RTX 3090/4090 + v2ProPlus/v4,实时合成
专业RTX 4090 多卡 + API 服务批量语音合成

为什么选择这个模型

  • 微调门槛最低:1 分钟音频即可
  • 中文克隆质量社区口碑第一梯队
  • Gradio WebUI 开箱即用
  • MIT 许可以及活跃的社区与插件生态

模型优点

  • 超短数据(1-2 分钟)微调效果显著
  • 中日英韩粤 + 跨语种合成
  • 零样本/少样本双模式
  • WebUI 与 API 齐全,上手快
  • 支持语速/情感等细粒度调节

模型缺点

  • 安装环境复杂(依赖多)
  • 底模选择与参数调试有学习成本
  • 长文需分段,偶有漏字
  • 说话人确认(SV 模块)配置繁琐

适合场景

  • 有声书、广播剧与游戏配音
  • 短视频/直播定制音色
  • 学习与创作私域语音克隆
  • 二次元角色声音二创

不适合场景

  • 商用语音 API 级质量(偶发稳定性问题)
  • 音乐与歌唱生成
  • 需要即开即用的托管方案

部署教程

vLLM
语音模型不走 vLLM 文本推理。实际推理:
git clone https://github.com/RVC-Boss/GPT-SoVITS.git && pip install -r requirements.txt
download 底模(https://huggingface.co/lj1995/GPT-SoVITS)放入 GPT_SoVITS/pretrained_models/
python webui.py_en.py 打开 Gradio:上传参考音频→零样本合成;或先录音 1 分钟做 few-shot 微调

智算工坊实验室

实测速度GPU 上接近实时合成(4090 远快于实时)
显存占用v2 约4GB,v4 约6-8GB
功耗整机约 200-300W
不同 GPU 对比3060 可跑推理;训练推荐至少 8GB 显存

常见问题 FAQ

需要多少数据能克隆音色?

30 秒-1 分钟的清晰人声即可微调;零样本模式只要几秒参考音频,但相似度与稳定性弱于微调。

底模 v2 / v4 / v2ProPlus 怎么选?

追求中文稳定性选 v4;要速度与 v2 硬件成本选 v2ProPlus(性能超 v4);v2 最省显存适合入门。

相关模型

相关工具

相关硬件

数据来源

  • https://huggingface.co/lj1995/GPT-SoVITS
  • https://github.com/RVC-Boss/GPT-SoVITS
  • https://github.com/RVC-Boss/GPT-SoVITS/wiki