开源 ASR 事实标准,多语言最强
模型介绍
Whisper 是 OpenAI 开源的语音识别(ASR)模型,Encoder-Decoder Transformer 把音频直接转成文本,支持 99 种语言识别与翻译。large-v3(2023-11)为最强开源 ASR,Common Voice 15 平均 WER 约 4.5%,中文居第一梯队;官方 large-v3-turbo 蒸馏版更快、显存减半。依托 faster-whisper、whisper.cpp 生态,消费级显卡即可超实时转写,是字幕、会议转写、语音助手的首选基座。
模型基本信息
开发机构OpenAI
模型版本Whisper large-v3(另有 large-v3-turbo)
参数规模tiny 39M / base 74M / small 244M / medium 769M / large-v3 1.5B
模型类型自动语音识别(ASR)/ 语音翻译
许可证MIT
上下文长度30 秒音频窗口(单次输入)
发布日期2023-11-07(large-v3)
模型架构Encoder-Decoder Transformer(音频→文本)
模型能力
中文能力很强
英文能力很强
代码能力N/A
推理能力N/A
长文本能力N/A
视觉能力N/A
工具调用N/A
模型版本
large-v31.54Blarge-v3-turbo809M(蒸馏)medium769Msmall244Mbase74Mtiny39M
模型获取
部署方式
faster-whisperwhisper.cpptransformersXinference
显存需求
large-v3 FP16约10GB
large-v3 int8约5GB
large-v3-turbo FP16约6GB
medium FP16约4GB
硬件推荐
RTX 3060可跑 large-v3 int8(约5GB)
RTX 3090可跑 large-v3 FP16
RTX 4090超实时识别(10x+ 实时)
RTX 5090超实时识别
MacM 系列可跑 medium/large
推荐配置
入门RTX 3060 12G + large-v3 int8(约5GB),实时转写
进阶RTX 4090 + large-v3 FP16,超实时转写
专业多卡 faster-whisper 批量转写 + 流式 API 服务
为什么选择这个模型
- 多语言 ASR 的最强开源基准
- 对噪声、口音、方言鲁棒
- faster-whisper / whisper.cpp 生态成熟
- MIT 许可,商用零门槛
- 消费级显卡即可超实时
模型优点
- 99 种语言识别与语音翻译
- 英文 WER 低至约 2-3%(LibriSpeech)
- 内置 VAD 与断句(faster-whisper)
- 极小版本 tiny/base 可跑手机端
模型缺点
- 中文标点与断句偏粗,需后处理
- 静音段可能产生幻觉文本
- 30 秒窗口,超长音频需切分
- large-v3 FP16 显存需求偏高
适合场景
- 字幕/双语字幕生成
- 会议、访谈、播客转写
- 音视频内容检索与索引
- 实时字幕与语音助手(turbo)
- 语音数据伪标签标注
不适合场景
- 需说话人分离(建议配 diarization)
- 端侧极低资源场景(可用 tiny)
- 要求逐词级精确时间戳
部署教程
vLLM
语音模型不走 vLLM。实际推理:faster-whisper
pip install faster-whisper
from faster_whisper import WhisperModel
model = WhisperModel("large-v3", device="cuda", compute_type="int8_float16")
segments, info = model.transcribe("audio.mp3", language="zh")
或 whisper.cpp:./main -m models/ggml-large-v3.bin -f audio.wav -l zh智算工坊实验室
实测速度large-v3 在 RTX 4090 上超实时(约 10-20x 实时)
显存占用约10GB(FP16)
功耗整机约 250-350W
不同 GPU 对比RTX 3060 已够用(int8 约 3-5x 实时)
常见问题 FAQ
Whisper 支持中文吗?质量如何?
支持,中文属开源第一梯队(large-v3 中文 WER 约 5% 上下)。标点与断句较粗,建议配合 VAD 与标点后处理使用。
large-v3 与 turbo 怎么选?
turbo 是 large-v3 的蒸馏版(809M),速度快数倍、显存减半,精度略降;追求精度选 large-v3,追求速度与低显存选 turbo。
相关模型
相关硬件
数据来源
- https://huggingface.co/openai/whisper-large-v3
- https://github.com/openai/whisper
- https://github.com/SYSTRAN/faster-whisper