CosyVoice

★★★★★ 4.4 分

阿里的强情感 TTS,支持音色克隆+情感+口播风格控制,中文效果极佳,Apache 协议完全免费商用。

语音合成情感克隆阿里
参数量CosyVoice 0.5B / CosyVoice2 0.5B
模型类型多模态 TTS(指令+情感+音色控制)
许可证Apache 2.0
开发者阿里巴巴 / FunAudioLLM
★★★★★ 4.8

阿里流式克隆王者,Apache 全开放

语音合成零样本克隆流式开源

模型介绍

CosyVoice 是阿里通义实验室 FunAudioLLM 的开源语音合成模型,CosyVoice2-0.5B 于 2025 年发布。采用「LLM 生成语音 token + Flow Matching + HiFi-GAN」范式,支持 9 种语言及 18+ 中文方言口音,具备零样本/跨语言克隆与指令控制情绪能力,原生流式。0.5B 参数、Apache-2.0 可商用,test-zh CER 1.45%、test-en WER 2.57%,是国产开源 TTS 口碑标杆。

模型基本信息

开发机构阿里通义实验室 / FunAudioLLM
模型版本CosyVoice2-0.5B
参数规模0.5B
模型类型文本转语音(TTS)/ 零样本与跨语言克隆
许可证Apache-2.0
上下文长度流式生成,支持长文本分批输出
发布日期2025-07-29(HF 仓库)
模型架构LLM(文本→语音 token)+ Flow Matching + HiFi-GAN(24kHz,流式)

模型能力

中文能力很强
英文能力强
代码能力N/A
推理能力N/A
长文本能力中(流式续写)
视觉能力N/A
工具调用N/A

模型版本

CosyVoice2-0.5B0.5BFun-CosyVoice3-0.5B(后续版本)0.5B

模型获取

部署方式

transformersgradioXinferencevllm-omni

显存需求

0.5B FP16(fp16=True)约5-8GB
0.5B TensorRT 加速约8-12GB

硬件推荐

RTX 30600.5B FP16 可跑,流式近实时
RTX 3090流畅流式合成
RTX 4090流式 RTF≈0.11-0.2,首包约0.5s
RTX 5090更低延迟,更高并发
MacM 系可跑,速度弱于独显

推荐配置

入门RTX 3060 12G + CosyVoice2-0.5B FP16
进阶RTX 4090 + FP16 + 流式(RTF≈0.15)
专业RTX 4090/5090 + TensorRT/vLLM 流式服务(首包<500ms,高并发)

为什么选择这个模型

  • Apache-2.0 完全开源可商用
  • 中文方言覆盖最广的开源克隆 TTS
  • 原生流式,首包延迟低
  • 阿里持续维护,社区与云生态完善

模型优点

  • 0.5B 轻量,消费级显卡可跑
  • 零样本/跨语言/指令控制三合一
  • 9 种语言 + 18 种中文方言口音
  • test-zh CER 1.45% 等评测表现优秀
  • 流式输出适合语音助手场景

模型缺点

  • 纯 Python 推理 RTF 偏高,需 TensorRT 才理想
  • 中文口音克隆需较多数据微调
  • 指令/情绪控制丰富度仍有上限
  • 初始化与首包有额外热身后开销

适合场景

  • 智能语音助手与实时对话
  • 中文短视频/有声内容配音
  • 方言与口音定制
  • 多语种跨语言配音实验
  • 商用产品(Apache-2.0)

不适合场景

  • 唱歌与音乐生成
  • 麦克风直出级超低功耗端侧
  • 与参考音频差异巨大的极端音色

部署教程

vLLM
语音模型不走 vLLM 文本推理。实际推理:
git clone https://github.com/FunAudioLLM/CosyVoice.git && pip install -r requirements-*.txt
from cosyvoice.cli.cosyvoice import CosyVoice, CosyVoice2
cosyvoice = CosyVoice2('pretrained_models/CosyVoice2-0.5B', load_jit=True, load_trt=True, fp16=True)
for item in cosyvoice.inference_zero_shot(text, prompt_text, prompt_speech_16k): ...

智算工坊实验室

实测速度RTX 4090 流式 RTF≈0.11-0.2,首包 0.3-0.6s;非流式 PyTorch 约 0.4-0.8
显存占用约5-8GB(FP16)
功耗整机约 250-350W
不同 GPU 对比3090 首包约0.8s,4090 约0.45s,50 系适配优化后可更低

常见问题 FAQ

CosyVoice2 为什么测试比官方宣称慢?

默认 Python+PyTorch 推理未加速,启用 load_trt=True(TensorRT)与 fp16=True 后流式 RTF 可降到约 0.15,与官方宣传一致。

克隆效果如何?

5-10 秒清晰参考音频即可稳定克隆;中文评测 test-zh CER 1.45%、说话人相似度 75.7%,社区反馈良好。

相关模型

相关工具

相关硬件

数据来源

  • https://huggingface.co/FunAudioLLM/CosyVoice2-0.5B
  • https://github.com/FunAudioLLM/CosyVoice
  • https://arxiv.org/abs/2412.10117
  • https://modelscope.cn/models/iic/CosyVoice2-0.5B