Bark

★★★★★ 4.3 分

Suno 开源的全能语音模型,不仅能说话,还能生成笑声、哭声、背景音效甚至简单音乐。

语音合成声音效果开源Suno
参数量Bark(约 1.2B)
模型类型生成式 TTS(语音+音效+音乐)
许可证MIT(非商用)
开发者Suno(原 TTS 团队)
★★★★★ 4.5

能唱歌、配乐、拟声的文本转音频

语音合成多模态音频开源

模型介绍

Bark 是 Suno AI 于 2023 年 4 月开源的文本转「音频」模型:不仅可朗读 13+ 种语言(含中文),还能生成音乐、环境音效与笑声、叹气等非语言人声。架构为三段式 GPT 级联(文本→语义→粗→细 token),由 EnCodec 解码为 24kHz 波形。完整版约 0.9B 参数、需约 12GB 显存常驻,另有 small 版可用 8GB 卡运行。MIT 许可、可商用,是多模态音频生成的代表作,但推理偏慢。

模型基本信息

开发机构Suno AI
模型版本Bark(完整版)
参数规模完整版约 0.9B(3×~300M);small 约 0.24B
模型类型文本转语音/音频(TTS + 音乐 + 音效)
许可证MIT
上下文长度每次约 13-15 秒音频,长文需分段
发布日期2023-04-25(HF 仓库)
模型架构三段式 GPT(语义→粗→细 token)+ EnCodec 音频编解码(24kHz)

模型能力

中文能力中
英文能力强
代码能力N/A
推理能力N/A
长文本能力弱(单次十几秒)
视觉能力N/A
工具调用N/A

模型版本

Bark(full)约0.9BBark-small约0.24B

模型获取

部署方式

transformersgradio

显存需求

Bark full 全部常驻 GPU约12GB
Bark-small约4-8GB
CPU offload 模式约2GB(慢)

硬件推荐

RTX 3060small 版或 full+CPU offload
RTX 3090full 版可常驻
RTX 4090full 版接近实时
RTX 5090full 版流畅批量
MacM 系列可跑,速度慢

推荐配置

入门RTX 3060 12G + Bark-small(约4-6GB)
进阶RTX 3090 + Bark full(约12GB)
专业RTX 4090 + full 批量合成音频素材

为什么选择这个模型

  • 文本生成音乐/音效/人声的全能模型
  • 非语言发声(笑、叹气、哭声)独特
  • MIT 许可,可商用
  • transformers 官方集成,部署简单

模型优点

  • 语音、音乐、环境音效多合一
  • 支持 13+ 语言含中文
  • 无需参考音频即可换预设音色
  • 小模型适合 8GB 卡

模型缺点

  • 推理慢(三段级联生成)
  • 单次仅十几秒,长音频要拼接
  • 中文/歌唱质量明显弱于英文语音
  • 带情绪的说话风格不够稳定

适合场景

  • 短视频音频素材与音效生成
  • 多模态音频创意实验
  • 简单歌曲/旋律 Demo
  • 游戏角色语气与拟声

不适合场景

  • 高保真语音克隆与有声书
  • 低延迟交互语音
  • 长音频一次性生成

部署教程

vLLM
语音模型不走 vLLM。实际推理:
pip install transformers scipy
from transformers import AutoProcessor, BarkModel
processor = AutoProcessor.from_pretrained("suno/bark-small")
model = BarkModel.from_pretrained("suno/bark-small").to("cuda")
inputs = processor("Hello, my dog is cute!", voice_preset="v2/en_speaker_6")
audio = model.generate(**inputs)
低显存可加 SUNO_OFFLOAD_CPU=True / SUNO_USE_SMALL_MODELS=True

智算工坊实验室

实测速度full 版在 4090 上接近实时;CPU 很慢
显存占用full 约12GB,small 约4-6GB
功耗整机约 250-350W
不同 GPU 对比full 需 12GB 常驻,3060 建议 small 或 offload

常见问题 FAQ

Bark 与普通 TTS 有什么区别?

Bark 是文本转「音频」,同一模型可出语音、音乐与音效,还能发笑、叹气;普通 TTS 只能朗读文本。

显存不够怎么办?

设 SUNO_USE_SMALL_MODELS=True 用 small 版,或 SUNO_OFFLOAD_CPU=True 把部分模型放到 CPU(约 2GB 显存可跑,速度慢)。

相关模型

相关工具

相关硬件

数据来源

  • https://huggingface.co/suno/bark
  • https://github.com/suno-ai/bark