Fish-Speech

★★★★★ 4.5 分

Fish Audio 的开源语音引擎,支持音色克隆、多语言与实时全双工对话,速度与效果俱佳。

语音合成克隆开源多语言
参数量Fish-Speech(约 0.5B)
模型类型全双工语音合成与克隆 TTS
许可证CC-BY-NC-SA / 商用需授权
开发者Fish Audio(子墨科技)
★★★★★ 4.8

百万小时语料的多语种 LLM 式 TTS

语音合成零样本克隆多语言开源

模型介绍

Fish-Speech 是 Fish Audio 开源社区基于 LLM 思想的 TTS,1.5 版本使用 100 万+ 小时多语种音频训练(英中各 30 万小时+等 13 语言)。双自回归架构:慢 AR 预测主语义 codebook,快 AR 补全声学细节,配合 Firefly-GAN 编解码。约 0.6B 参数,RTX 4060 笔记本约 5x 实时、4090 约 10-15x,8GB 显存可跑。权重 CC-BY-NC-SA 非商用、代码 Apache-2.0,是流式交互热门选择。

模型基本信息

开发机构Fish Audio(开源社区)
模型版本Fish-Speech 1.5
参数规模约0.6B(Dual-AR:语义 24 层 + 声学 4 层)
模型类型文本转语音(TTS)/ 零样本克隆 / 情感控制
许可证CC-BY-NC-SA-4.0(权重);代码 Apache-2.0
上下文长度文本到 token 生成,长文可流式
发布日期2024-11-24(HF 仓库)
模型架构Dual-AR 双自回归(LLM 式)+ Firefly-GAN VQ 编解码

模型能力

中文能力强
英文能力强
代码能力N/A
推理能力N/A
长文本能力中(支持长文本与流式)
视觉能力N/A
工具调用N/A

模型版本

Fish-Speech 1.5约0.6BFish-Speech 1.4约0.4B(社区常称)Fish Audio S2-Pro(商业/后续)4B + 400M(Dual-AR)

模型获取

部署方式

transformersgradioXinference

显存需求

1.5 推理(FP16)约4GB(8GB 卡可跑)
1.5 启动基础占用约1.8GB

硬件推荐

RTX 30608GB 卡可跑,约5x实时
RTX 3090流畅高质量合成
RTX 4090RTF≈0.15-0.2,10x+实时
RTX 5090更高吞吐
MacM 系列 32GB+ 统一内存体验佳

推荐配置

入门RTX 3060 12G + 1.5(约4GB 显存)
进阶RTX 4090 + 1.5 FP16,RTF≈0.15
专业RTX 4090/5090 + --compile 加速 + API 服务批量合成

为什么选择这个模型

  • 百万小时级多语种语料,发音错误少
  • Dual-AR 架构生成稳定
  • 支持 [laughing]/[whispering] 等情感标签
  • 13 种语言,中文英文表现均衡

模型优点

  • 中文/英文/日文等多语种强
  • RTF 快,消费级显卡 5-15x 实时
  • 原生支持流式与情感标签
  • 代码 Apache-2.0,可微调与部署

模型缺点

  • 权重 CC-BY-NC-SA 非商用
  • 权重需 HF 申请同意(gated)
  • 非中文语种质量参差(方言差)
  • 长音频流式对显存有压力

适合场景

  • 多语种零样本克隆创作
  • 流式语音助手
  • 有声内容与游戏角色配音
  • 情感标签驱动的表演式朗读

不适合场景

  • 商用发布(受 CC-BY-NC-SA 限制)
  • 中文方言定制(可用 CosyVoice)
  • 极小显存设备

部署教程

vLLM
语音模型不走 vLLM 文本推理。实际推理:
git clone https://github.com/fishaudio/fish-speech.git && pip install -e .
# 需在 HF 同意授权后下载权重
python tools/run_webui.py --llama-checkpoint-path checkpoints/fish-speech-1.5/ --decoder-checkpoint-path checkpoints/fish-speech-1.5/firefly-gan-vq-fsq-8x1024-21hz-generator.pth
或命令行:python fish_speech/models/text2semantic/inference.py --text ... --prompt-text ... --prompt-tokens semantic.npy --checkpoint-path ... (加速加 --compile)

智算工坊实验室

实测速度RTX 4060 笔记本约 5x 实时;RTX 4090 约 10-15x(RTF 0.15-0.2)
显存占用推理约4GB(基础占用约1.8GB)
功耗整机约 200-300W
不同 GPU 对比8GB 卡可跑;4090 可并发批量

常见问题 FAQ

Fish-Speech 权重怎么下载?

HF 仓库为 gated 模型,需在模型页同意额外条款(仅限非商用),再用 huggingface-cli 或 hf download 下载。

如何加速?

推理脚本加 --compile 融合 CUDA 内核可提升约 10x(约 30→300 token/s);也可用其 fish-tech 加速方案。

相关模型

相关工具

相关硬件

数据来源

  • https://huggingface.co/fishaudio/fish-speech-1.5
  • https://github.com/fishaudio/fish-speech
  • https://arxiv.org/abs/2411.01156