流匹配零样本克隆,自然度速度兼得
模型介绍
F5-TTS 由上海交大 X-LANCE、剑桥、吉利研究院团队(SWivid)开源,2024 年 10 月发布。采用 DiT Flow Matching 直接生成梅尔谱,配 Vocos 声码器输出 24kHz 音频,绕开文本-音素对齐难题,5-10 秒参考音频即可零样本克隆中英文音色,跨语言合成也自然。Base 模型 335.8M 参数,GPU 服务端 RTF 低至约 0.04,是开源克隆模型中自然度与速度平衡最好的之一;2025 年 3 月 v1 Base 进一步提升了质量。
模型基本信息
开发机构SWivid(上海交大 X-LANCE / 剑桥 / 吉利研究院)
模型版本F5-TTS Base(v1)
参数规模335.8M(Base)
模型类型文本转语音(TTS)/ 零样本语音克隆
许可证CC-BY-NC-4.0(非商用)
上下文长度单次约 30-60 秒语音,支持续写生成更长
发布日期2024-10-07(HF 仓库)
模型架构DiT Flow Matching + ConvNeXt V2 + Vocos 声码器(24kHz)
模型能力
中文能力强
英文能力强
代码能力N/A
推理能力N/A
长文本能力中(长文本需分批与续写)
视觉能力N/A
工具调用N/A
模型版本
F5-TTS v1 Base335.8MF5-TTS Base335.8M
模型获取
部署方式
transformersgradioXinference
显存需求
Base FP16约4GB
Base 低精度/量化约2-3GB
硬件推荐
RTX 3060可跑 Base FP16,实时合成
RTX 3090高质量克隆,更长音频
RTX 4090RTF≈0.04,接近即时
RTX 5090更快批量合成
MacM 系列可跑,速度明显慢于独显
推荐配置
入门RTX 3060 12G + Base FP16(约4GB)
进阶RTX 4090 + Base FP16,RTF≈0.04
专业多卡批量合成或 TRT-LLM 服务端部署
为什么选择这个模型
- 开源克隆模型中自然度第一梯队
- RTF 快,GPU 上接近即时
- 中英双语与跨语言克隆友好
- 参考音频仅需 5-10 秒
模型优点
- 无需强制对齐的简洁架构
- 少量参考音频即可稳定克隆
- 中文+英文混合文本支持好
- 社区活跃,v1 Base 持续更新
- 显存需求低(约4GB)
模型缺点
- CC-BY-NC-4.0 非商用授权
- 长文本需分批生成
- 参考语音质量影响克隆效果
- 人声之外的歌唱/音效不支持
适合场景
- 有声书与短视频配音克隆
- 个性化音色文本朗读
- 跨语言配音实验
- 低延迟交互式配音 Demo
不适合场景
- 商用产品(受 CC-BY-NC 限制)
- 唱歌与音乐创作
- 需几十分钟长音频一次性生成
部署教程
vLLM
语音模型不走 vLLM 文本推理。实际推理: pip install f5-tts f5-tts_infer-gradio gradio 界面选择参考音频(gen_text 与 ref_audio 需同音色)生成 或 Python 调用 f5_tts.infer 的 inference API 接口
智算工坊实验室
实测速度Base+Vocos 在 RTX 4090 上 RTF≈0.04(服务端),PyTorch 离线约 0.15
显存占用约4GB(FP16)
功耗整机约 200-300W
不同 GPU 对比3060 即可实时;4090 接近即时生成
常见问题 FAQ
F5-TTS 能商用吗?
模型权重为 CC-BY-NC-4.0(非商用)。商用授权需联系团队确认,或改用可商用授权(如 CosyVoice2 的 Apache-2.0)。
参考音频要满足什么条件?
5-10 秒清晰、无背景音乐、带对应文本转写的人声即可;音质越好克隆越稳。可多次随机换取更稳定效果。
相关模型
相关工具
相关硬件
数据来源
- https://huggingface.co/SWivid/F5-TTS
- https://github.com/SWivid/F5-TTS
- https://arxiv.org/abs/2410.06885