百万小时语料的多语种 LLM 式 TTS
模型介绍
Fish-Speech 是 Fish Audio 开源社区基于 LLM 思想的 TTS,1.5 版本使用 100 万+ 小时多语种音频训练(英中各 30 万小时+等 13 语言)。双自回归架构:慢 AR 预测主语义 codebook,快 AR 补全声学细节,配合 Firefly-GAN 编解码。约 0.6B 参数,RTX 4060 笔记本约 5x 实时、4090 约 10-15x,8GB 显存可跑。权重 CC-BY-NC-SA 非商用、代码 Apache-2.0,是流式交互热门选择。
模型基本信息
开发机构Fish Audio(开源社区)
模型版本Fish-Speech 1.5
参数规模约0.6B(Dual-AR:语义 24 层 + 声学 4 层)
模型类型文本转语音(TTS)/ 零样本克隆 / 情感控制
许可证CC-BY-NC-SA-4.0(权重);代码 Apache-2.0
上下文长度文本到 token 生成,长文可流式
发布日期2024-11-24(HF 仓库)
模型架构Dual-AR 双自回归(LLM 式)+ Firefly-GAN VQ 编解码
模型能力
中文能力强
英文能力强
代码能力N/A
推理能力N/A
长文本能力中(支持长文本与流式)
视觉能力N/A
工具调用N/A
模型版本
Fish-Speech 1.5约0.6BFish-Speech 1.4约0.4B(社区常称)Fish Audio S2-Pro(商业/后续)4B + 400M(Dual-AR)
模型获取
部署方式
transformersgradioXinference
显存需求
1.5 推理(FP16)约4GB(8GB 卡可跑)
1.5 启动基础占用约1.8GB
硬件推荐
RTX 30608GB 卡可跑,约5x实时
RTX 3090流畅高质量合成
RTX 4090RTF≈0.15-0.2,10x+实时
RTX 5090更高吞吐
MacM 系列 32GB+ 统一内存体验佳
推荐配置
入门RTX 3060 12G + 1.5(约4GB 显存)
进阶RTX 4090 + 1.5 FP16,RTF≈0.15
专业RTX 4090/5090 + --compile 加速 + API 服务批量合成
为什么选择这个模型
- 百万小时级多语种语料,发音错误少
- Dual-AR 架构生成稳定
- 支持 [laughing]/[whispering] 等情感标签
- 13 种语言,中文英文表现均衡
模型优点
- 中文/英文/日文等多语种强
- RTF 快,消费级显卡 5-15x 实时
- 原生支持流式与情感标签
- 代码 Apache-2.0,可微调与部署
模型缺点
- 权重 CC-BY-NC-SA 非商用
- 权重需 HF 申请同意(gated)
- 非中文语种质量参差(方言差)
- 长音频流式对显存有压力
适合场景
- 多语种零样本克隆创作
- 流式语音助手
- 有声内容与游戏角色配音
- 情感标签驱动的表演式朗读
不适合场景
- 商用发布(受 CC-BY-NC-SA 限制)
- 中文方言定制(可用 CosyVoice)
- 极小显存设备
部署教程
vLLM
语音模型不走 vLLM 文本推理。实际推理: git clone https://github.com/fishaudio/fish-speech.git && pip install -e . # 需在 HF 同意授权后下载权重 python tools/run_webui.py --llama-checkpoint-path checkpoints/fish-speech-1.5/ --decoder-checkpoint-path checkpoints/fish-speech-1.5/firefly-gan-vq-fsq-8x1024-21hz-generator.pth 或命令行:python fish_speech/models/text2semantic/inference.py --text ... --prompt-text ... --prompt-tokens semantic.npy --checkpoint-path ... (加速加 --compile)
智算工坊实验室
实测速度RTX 4060 笔记本约 5x 实时;RTX 4090 约 10-15x(RTF 0.15-0.2)
显存占用推理约4GB(基础占用约1.8GB)
功耗整机约 200-300W
不同 GPU 对比8GB 卡可跑;4090 可并发批量
常见问题 FAQ
Fish-Speech 权重怎么下载?
HF 仓库为 gated 模型,需在模型页同意额外条款(仅限非商用),再用 huggingface-cli 或 hf download 下载。
如何加速?
推理脚本加 --compile 融合 CUDA 内核可提升约 10x(约 30→300 token/s);也可用其 fish-tech 加速方案。
相关模型
相关工具
相关硬件
数据来源
- https://huggingface.co/fishaudio/fish-speech-1.5
- https://github.com/fishaudio/fish-speech
- https://arxiv.org/abs/2411.01156