Whisper

★★★★★ 4.8 分

OpenAI 开源的多语言语音识别模型,准确率高、本地运行免费,视频/会议/播客转写首选,几行命令即可部署。

语音识别转写OpenAI开源
参数量tiny/base/small/medium/large-v3(0.04B~1.5B)
模型类型语音转文字(ASR)模型
许可证MIT
开发者OpenAI
★★★★★ 4.9

开源 ASR 事实标准,多语言最强

语音识别开源多语言

模型介绍

Whisper 是 OpenAI 开源的语音识别(ASR)模型,Encoder-Decoder Transformer 把音频直接转成文本,支持 99 种语言识别与翻译。large-v3(2023-11)为最强开源 ASR,Common Voice 15 平均 WER 约 4.5%,中文居第一梯队;官方 large-v3-turbo 蒸馏版更快、显存减半。依托 faster-whisper、whisper.cpp 生态,消费级显卡即可超实时转写,是字幕、会议转写、语音助手的首选基座。

模型基本信息

开发机构OpenAI
模型版本Whisper large-v3(另有 large-v3-turbo)
参数规模tiny 39M / base 74M / small 244M / medium 769M / large-v3 1.5B
模型类型自动语音识别(ASR)/ 语音翻译
许可证MIT
上下文长度30 秒音频窗口(单次输入)
发布日期2023-11-07(large-v3)
模型架构Encoder-Decoder Transformer(音频→文本)

模型能力

中文能力很强
英文能力很强
代码能力N/A
推理能力N/A
长文本能力N/A
视觉能力N/A
工具调用N/A

模型版本

large-v31.54Blarge-v3-turbo809M(蒸馏)medium769Msmall244Mbase74Mtiny39M

模型获取

部署方式

faster-whisperwhisper.cpptransformersXinference

显存需求

large-v3 FP16约10GB
large-v3 int8约5GB
large-v3-turbo FP16约6GB
medium FP16约4GB

硬件推荐

RTX 3060可跑 large-v3 int8(约5GB)
RTX 3090可跑 large-v3 FP16
RTX 4090超实时识别(10x+ 实时)
RTX 5090超实时识别
MacM 系列可跑 medium/large

推荐配置

入门RTX 3060 12G + large-v3 int8(约5GB),实时转写
进阶RTX 4090 + large-v3 FP16,超实时转写
专业多卡 faster-whisper 批量转写 + 流式 API 服务

为什么选择这个模型

  • 多语言 ASR 的最强开源基准
  • 对噪声、口音、方言鲁棒
  • faster-whisper / whisper.cpp 生态成熟
  • MIT 许可,商用零门槛
  • 消费级显卡即可超实时

模型优点

  • 99 种语言识别与语音翻译
  • 英文 WER 低至约 2-3%(LibriSpeech)
  • 内置 VAD 与断句(faster-whisper)
  • 极小版本 tiny/base 可跑手机端

模型缺点

  • 中文标点与断句偏粗,需后处理
  • 静音段可能产生幻觉文本
  • 30 秒窗口,超长音频需切分
  • large-v3 FP16 显存需求偏高

适合场景

  • 字幕/双语字幕生成
  • 会议、访谈、播客转写
  • 音视频内容检索与索引
  • 实时字幕与语音助手(turbo)
  • 语音数据伪标签标注

不适合场景

  • 需说话人分离(建议配 diarization)
  • 端侧极低资源场景(可用 tiny)
  • 要求逐词级精确时间戳

部署教程

vLLM
语音模型不走 vLLM。实际推理:faster-whisper
pip install faster-whisper
from faster_whisper import WhisperModel
model = WhisperModel("large-v3", device="cuda", compute_type="int8_float16")
segments, info = model.transcribe("audio.mp3", language="zh")
或 whisper.cpp:./main -m models/ggml-large-v3.bin -f audio.wav -l zh

智算工坊实验室

实测速度large-v3 在 RTX 4090 上超实时(约 10-20x 实时)
显存占用约10GB(FP16)
功耗整机约 250-350W
不同 GPU 对比RTX 3060 已够用(int8 约 3-5x 实时)

常见问题 FAQ

Whisper 支持中文吗?质量如何?

支持,中文属开源第一梯队(large-v3 中文 WER 约 5% 上下)。标点与断句较粗,建议配合 VAD 与标点后处理使用。

large-v3 与 turbo 怎么选?

turbo 是 large-v3 的蒸馏版(809M),速度快数倍、显存减半,精度略降;追求精度选 large-v3,追求速度与低显存选 turbo。

相关模型

相关硬件

数据来源

  • https://huggingface.co/openai/whisper-large-v3
  • https://github.com/openai/whisper
  • https://github.com/SYSTRAN/faster-whisper