阿里流式克隆王者,Apache 全开放
模型介绍
CosyVoice 是阿里通义实验室 FunAudioLLM 的开源语音合成模型,CosyVoice2-0.5B 于 2025 年发布。采用「LLM 生成语音 token + Flow Matching + HiFi-GAN」范式,支持 9 种语言及 18+ 中文方言口音,具备零样本/跨语言克隆与指令控制情绪能力,原生流式。0.5B 参数、Apache-2.0 可商用,test-zh CER 1.45%、test-en WER 2.57%,是国产开源 TTS 口碑标杆。
模型基本信息
开发机构阿里通义实验室 / FunAudioLLM
模型版本CosyVoice2-0.5B
参数规模0.5B
模型类型文本转语音(TTS)/ 零样本与跨语言克隆
许可证Apache-2.0
上下文长度流式生成,支持长文本分批输出
发布日期2025-07-29(HF 仓库)
模型架构LLM(文本→语音 token)+ Flow Matching + HiFi-GAN(24kHz,流式)
模型能力
中文能力很强
英文能力强
代码能力N/A
推理能力N/A
长文本能力中(流式续写)
视觉能力N/A
工具调用N/A
模型版本
CosyVoice2-0.5B0.5BFun-CosyVoice3-0.5B(后续版本)0.5B
模型获取
部署方式
transformersgradioXinferencevllm-omni
显存需求
0.5B FP16(fp16=True)约5-8GB
0.5B TensorRT 加速约8-12GB
硬件推荐
RTX 30600.5B FP16 可跑,流式近实时
RTX 3090流畅流式合成
RTX 4090流式 RTF≈0.11-0.2,首包约0.5s
RTX 5090更低延迟,更高并发
MacM 系可跑,速度弱于独显
推荐配置
入门RTX 3060 12G + CosyVoice2-0.5B FP16
进阶RTX 4090 + FP16 + 流式(RTF≈0.15)
专业RTX 4090/5090 + TensorRT/vLLM 流式服务(首包<500ms,高并发)
为什么选择这个模型
- Apache-2.0 完全开源可商用
- 中文方言覆盖最广的开源克隆 TTS
- 原生流式,首包延迟低
- 阿里持续维护,社区与云生态完善
模型优点
- 0.5B 轻量,消费级显卡可跑
- 零样本/跨语言/指令控制三合一
- 9 种语言 + 18 种中文方言口音
- test-zh CER 1.45% 等评测表现优秀
- 流式输出适合语音助手场景
模型缺点
- 纯 Python 推理 RTF 偏高,需 TensorRT 才理想
- 中文口音克隆需较多数据微调
- 指令/情绪控制丰富度仍有上限
- 初始化与首包有额外热身后开销
适合场景
- 智能语音助手与实时对话
- 中文短视频/有声内容配音
- 方言与口音定制
- 多语种跨语言配音实验
- 商用产品(Apache-2.0)
不适合场景
- 唱歌与音乐生成
- 麦克风直出级超低功耗端侧
- 与参考音频差异巨大的极端音色
部署教程
vLLM
语音模型不走 vLLM 文本推理。实际推理:
git clone https://github.com/FunAudioLLM/CosyVoice.git && pip install -r requirements-*.txt
from cosyvoice.cli.cosyvoice import CosyVoice, CosyVoice2
cosyvoice = CosyVoice2('pretrained_models/CosyVoice2-0.5B', load_jit=True, load_trt=True, fp16=True)
for item in cosyvoice.inference_zero_shot(text, prompt_text, prompt_speech_16k): ...智算工坊实验室
实测速度RTX 4090 流式 RTF≈0.11-0.2,首包 0.3-0.6s;非流式 PyTorch 约 0.4-0.8
显存占用约5-8GB(FP16)
功耗整机约 250-350W
不同 GPU 对比3090 首包约0.8s,4090 约0.45s,50 系适配优化后可更低
常见问题 FAQ
CosyVoice2 为什么测试比官方宣称慢?
默认 Python+PyTorch 推理未加速,启用 load_trt=True(TensorRT)与 fp16=True 后流式 RTF 可降到约 0.15,与官方宣传一致。
克隆效果如何?
5-10 秒清晰参考音频即可稳定克隆;中文评测 test-zh CER 1.45%、说话人相似度 75.7%,社区反馈良好。
相关模型
相关工具
相关硬件
数据来源
- https://huggingface.co/FunAudioLLM/CosyVoice2-0.5B
- https://github.com/FunAudioLLM/CosyVoice
- https://arxiv.org/abs/2412.10117
- https://modelscope.cn/models/iic/CosyVoice2-0.5B